AI 快讯 · 第 53 页
-
Sakana AI 推出企业级自主研究代理 Marlin,可生成 100 页报告与幻灯片
Sakana AI 发布首款商业产品 Sakana Marlin,一个面向企业的自主研究代理。它能在 8 小时内自动完成研究并输出长达 100 页的报告和幻灯片,基于 AB-MCTS 架构。本文详解其工作原理、应用场景及对中文企业用户的启示。
-
SQLite 查询结果溯源:将列映射回原始 table.column 的三种方法
Simon Willison 探索了如何将 SQLite 查询结果列自动映射回其来源 table.column,使用 Claude Code 找到了三种方案:apsw、ctypes 调用 C 函数、以及 EXPLAIN 分析。对 Datasette 用户和 Python 开发者有实用价值。
-
Databricks 开源 Omnigent:统一管理 Claude Code、Codex 等 AI 编程 Agent 的元框架
Databricks 开源了 Omnigent,一个位于 Claude Code、Codex 和 Pi 等编程 Agent 之上的元框架,提供统一的组合、策略控制和会话共享能力。本文详解其架构、三大核心能力及中文用户的实际应用场景。
-
AI编程代理找对文件却找不对关键代码行,SWE-Explore基准测试揭示短板
新基准SWE-Explore首次将代码搜索与修复分开测试,发现Claude Code、Codex等AI编程代理虽能准确定位文件,但多数情况下遗漏关键代码行。对中文开发者而言,这意味着依赖AI修复bug时需人工校验定位精度,国产工具如通义灵码或需针对性优化。
-
KPMG 报告伪造 AI 案例:UBS、NHS 案例被指虚构,GPTZero CEO 警告“二次幻觉”
四大会计师事务所毕马威(KPMG)发布的一份 AI 商业报告被发现包含伪造的案例研究,涉及瑞银(UBS)、英国国家医疗服务体系(NHS)等机构。GPTZero CEO Edward Tian 参与揭露此事,并警告“二次幻觉”——来自可信咨询公司的错误主张会不受检查地传播。KPMG 已撤回该报告。本文分析事件详情及对中文圈企业的启示。
-
Google Cloud 发布 Open Knowledge Format:将散落文档转为 Markdown 供 AI Agent 使用
Google Cloud 推出 Open Knowledge Format (OKF),将企业散落的文档标准化为 Markdown 文件,便于 AI Agent 读取和利用。该格式基于 Andrej Karpathy 提出的“LLM Wiki”模式,旨在提升知识库的便携性和 AI 可访问性。了解 OKF 如何改变企业知识管理。
-
微软研究院Mirage:用潜空间记忆实现长镜头视频生成空间一致性
微软研究院联合多所大学推出Mirage视频世界模型,通过将场景信息存储在潜空间而非像素点云,大幅降低计算开销并保持长镜头空间一致性。本文解读其技术原理、当前局限,并分析对中文视频生成赛道的影响。
-
美国强制Anthropic关闭Claude 5海外访问:AGI时代AI治理的起点
美国白宫强制Anthropic暂停Claude 5 Mythos/Fable模型对海外用户开放,标志AI治理进入新阶段。本文分析事件始末、对开源社区的影响,以及中文用户面临的监管与替代选择。
-
FineWeb 数据集实战教程:流式处理、质量过滤、去重与分词分析
本文通过代码实战演示如何使用 FineWeb 数据集进行流式采样、质量过滤(Gopher/C4 规则)、MinHash 近重复检测、GPT-2 分词验证及域名/语言分数分析,帮助中文开发者掌握大规模网页语料库的处理技术。
-
OpenAI WebRTC 音频对话工具更新:支持 GPT-Realtime-2 模型与文档上下文粘贴
开发者 Simon Willison 更新了其 OpenAI WebRTC 音频对话演示工具,新增 GPT-Realtime-2 模型选择,并允许粘贴文档作为对话上下文。中文用户可通过浏览器体验实时语音对话,但需 API Key 和网络条件。
-
美国政府以国家安全为由要求暂停Fable 5和Mythos 5访问,Anthropic被迫关闭所有用户权限
美国政府援引国家安全权力,要求Anthropic暂停Fable 5和Mythos 5对所有外国国民的访问,包括外籍员工。Anthropic被迫立即关闭这两个模型,但其他模型不受影响。政府声称发现了一种越狱方法,但Anthropic认为该方法仅能发现已知小漏洞,且其他公开模型也能做到。
-
城市功能推断:用city2graph、OSMnx和PyTorch Geometric实现空间图神经网络编码教程
本文详细介绍如何用city2graph、OSMnx和PyTorch Geometric构建端到端空间图学习管道,从OpenStreetMap收集POI数据,构建多种邻近图,训练GraphSAGE模型预测城市功能类别。适合GIS和GNN开发者参考。
-
月之暗面开源Kimi K2.7-Code编程模型:代码能力提升21.8%,256K上下文,API可用
月之暗面开源了Kimi K2.7-Code,一款专注编程的Agent模型,基于K2.6升级,代码基准提升21.8%,推理token减少30%,支持256K上下文,可通过Kimi API和Kimi Code使用。
-
美国政府强制Anthropic全球禁用Claude Fable 5和Mythos 5,称存在越狱风险
美国政府以越狱风险为由,命令Anthropic在全球范围内关闭Claude Fable 5和Mythos 5模型。Anthropic表示漏洞轻微且竞品也存在,但已遵守。此举可能为前沿模型部署设下危险先例,对AI行业监管和用户选择产生深远影响。
-
Anthropic 应美国政府要求关闭 Claude Fable 5 和 Mythos 5,出口管制令生效
Anthropic 在 2026 年 6 月 12 日收到美国商务部出口管制指令后,关闭了刚发布三天的 Claude Fable 5 和 Mythos 5 模型。本文梳理事件经过、模型状态、安全机制及对中文开发者的影响。
-
月之暗面开源万亿参数编程模型 Kimi K2.7 Code,每 token 价格仅为 GPT-5.5 和 Claude 的 1/12
月之暗面发布开源编程模型 Kimi K2.7 Code,拥有 1 万亿参数,在编程基准测试中虽不及 GPT-5.5 和 Claude Opus 4.8,但价格低至 1/12。本文分析其性价比、对中文开发者的意义及与国产模型的对比。
-
Claude Fable 5 在 FrontierMath 最难题目上超越 GPT-5.5 达 13 个百分点,AI 数学推理能力再跃升
Anthropic 最新模型 Claude Fable 5 在 FrontierMath 最困难级别上达到 88% 准确率,远超 GPT-5.5 的 75%,较年初 Opus 4.5 的不足 10% 实现飞跃。本文解析这一突破对数学研究、AI 评测及中文用户的实际意义。
-
Google Research 发布 Gemini-SQL2,文本转 SQL 准确率 80.04% 大幅领先 OpenAI 和 Anthropic
Google Research 推出基于 Gemini 3.1 Pro 的 Gemini-SQL2,在 BIRD 基准测试中以 80.04% 准确率大幅领先 OpenAI 和 Anthropic。本文解析其技术细节、对中文用户的数据分析场景影响,以及与国产模型的对比。
-
微软CEO纳德拉承认自己也是“token滥用者”:这会上瘾,但前沿模型不该用于日常任务
微软CEO萨提亚·纳德拉警告不要对每个问题都使用最强AI模型(token-maxing),认为前沿模型不应浪费在日常任务上,边际生产力收益需匹配token成本。但他也承认自己难以抗拒。本文解读这一现象对中文用户和企业的启示。
-
Count Anything模型发布:用文本提示即可精准计数图像中任意物体,错误率减半
Count Anything是首个通过文本提示计数图像中任意物体(从人群到细胞样本)的AI模型,在对比测试中错误率较此前系统降低一半。本文详解其原理、局限及对中文用户的实际价值。