AI 快讯 编译自 marktechpost #模型发布#长上下文#数据安全

Pokee AI 发布 Pokee-Isaac 28B:千万 token 上下文代理模型,专为数据不出域设计

Pokee AI 推出 Pokee-Isaac 28B,支持 1000 万 token 上下文,RULER 得分 93.3%,可部署在 VPC、本地或设备端。本文解析其性能、定价及对国内数据合规场景的启示。

编译发布 2026/08/08 原文发布 2026/08/08

一句话看懂

Pokee AI 发布 Pokee-Isaac 28B,一个支持 1000 万 token 上下文的纯文本模型,专为在客户边界内运行而设计,解决长任务代理的上下文累积问题。

详细发生了什么

长周期代理在解决任务的过程中,上下文会不断累积。目前能同时处理长上下文并保持连贯性的模型几乎都依赖云端 API,这限制了受监管行业、公共部门及设备端应用的使用,因为这些场景的数据不允许离开本地。Pokee AI 推出的 Pokee-Isaac 28B 正是为此设计。它拥有 1000 万 token 的上下文窗口,并声称在 RULER 基准上达到 93.3% 的准确率,与最强的云端基线模型持平,且单个 GPU 即可运行。

模型通过 OpenAI 兼容的 API 提供,并支持在 VPC、本地或设备端部署,但权重不公开,需要商业授权。发布时已支持 vLLM 和 SGLang,消费级 GPU(如 RTX 4090)也能运行,但官方测量数据仅基于 B200 级 GPU。

在长上下文测试中,Isaac 在 RULER 上从 512K 到 10M 长度均保持 93.3% 以上,而对比的 GPT-5.6 Luna 和 Gemini 3.5 Flash Lite 在 1M 时已溢出。在代理能力方面,Isaac 在 BFCL v4 上以 70.94 分领先,在 τ³-bench 上平均 0.662,在 Terminal-Bench 2.1 上解决 65.1% 的任务,略逊于 Luna 的 60 分。安全测试中,DTAP 攻击成功率最低(综合 35.6%),同时保持 82.5% 的正常任务成功率。

定价方面,输入/输出每百万 token 分别为 $0.15/$1.00,标记为暂定价格。模型还支持在 Intel Arc Pro B70、Core Ultra Series 3 及 Qualcomm Snapdragon X2 Elite 上完全本地运行。

中文圈视角

对国内用户来说,这个模型的意义在于数据合规。国内金融、医疗、政务等行业对数据出境有严格限制,而 Pokee-Isaac 28B 的本地部署模式正好契合这一需求。不过,国内已有类似方案,比如阿里云的 Qwen 系列、智谱的 GLM 系列都支持私有化部署,且部分开源。Pokee-Isaac 28B 的优势在于 1000 万 token 的上下文,但国内用户需要权衡:是否值得为这个超长上下文付费,还是用开源模型配合上下文压缩技术来替代。此外,模型权重不公开,意味着无法自行审查或微调,这对追求自主可控的国内企业可能是个障碍。

几条值得记住的细节

  • RULER 基准上,Isaac 在 10M token 长度下得分 93.3%,而所有对比基线在 2M 以上均为 0.0。
  • 在单块 B200 GPU 上,预填充吞吐量在 10M 上下文时达到 137,200 tokens/s,解码速度稳定在约 335 tokens/s。
  • BFCL v4 得分 70.94,略高于 Luna 的 70.61;Terminal-Bench 2.1 解决 56/86 个任务,落后于 Luna 的 60 个。
  • DTAP 红队测试中,综合攻击成功率最低(35.6%),正常任务成功率为 82.5%。
  • 定价为每百万 token 输入 $0.15、输出 $1.00,且支持本地设备运行。

一句话总结

超长上下文模型开始走向本地部署,但国内用户需对比开源方案,权衡成本与自主性。