AI 快讯 · 第 48 页
-
Cisco AI 开源 FAPO:用 Claude Code 自动优化多步 LLM 流水线,准确率提升最高 33.8 个百分点
Cisco Foundation AI 开源了 FAPO(全自动提示优化)系统,利用 Claude Code 自动诊断多步 LLM 流水线中的失败步骤,并逐级优化提示、参数和链结构。在 18 项模型-基准测试对比中,FAPO 击败了当前最先进的 GEPA 优化器,平均增益达 14.1 个百分点。本文详解其工作原理、性能数据和中文用户的实际应用价值。
-
Datasette Apps 0.1a2 发布:强化 CSP 权限控制与键盘导航查询选择器
Datasette Apps 0.1a2 版本发布,新增 apps-set-csp 权限和 allowed_csp_origins 插件白名单,强化自定义网络/CSP 来源安全。同时改进存储查询选择器支持键盘导航,修复全屏模式下的链接确认弹窗和日志面板问题。适合使用 Datasette 构建数据应用的开发者。
-
Datasette Apps 发布:在 Datasette 内托管自定义 HTML 应用,支持 SQL 查询
Datasette 团队推出 datasette-apps 插件,允许用户在 Datasette 实例中托管自包含的 HTML+JavaScript 应用,并通过 iframe 沙箱安全执行只读或写入 SQL 查询。本文详解其设计动机、使用场景,并分析对中文数据爱好者的实际价值。
-
Salesforce CodeGen 教程:用单元测试和安全检查生成、验证、重排 Python 函数
本文实现了一个完整的 Salesforce CodeGen 工作流,涵盖函数提取、语法检查、静态安全分析、单元测试验证、候选重排和多轮合成。适合想用开源模型搭建代码生成管道的开发者。
-
英国e2e-assure发布Cumulo:主权AI驱动的零日SOC平台,保护IT与OT环境
e2e-assure推出Cumulo,英国唯一主权AI优先SOC平台,结合数字孪生与客户专属AI模型,实现零日威胁检测。本文解析其技术架构、对中文圈用户的安全启示及与国产方案的对比。
-
OpenAI 研究:少量“有益特质”训练让 AI 模型更安全且更难被操纵
OpenAI 研究发现,对 AI 模型进行少量“有益特质”(如诚实、可纠正性)的强化学习训练,能跨领域提升安全性,在 53 项基准测试中 44 项表现更优。本文解读该方法与 Anthropic 宪法式方法的区别,并分析对中文圈用户的实际意义。
-
Liquid AI 发布 LFM2.5 检索模型:350M 参数、11 语言、边缘设备可用的多语言搜索方案
Liquid AI 推出 LFM2.5-Embedding-350M 和 LFM2.5-ColBERT-350M 两个检索模型,支持 11 种语言的多语言和跨语言搜索,可在 CPU、笔记本等边缘设备运行。本文详解架构变化、性能对比、部署方式,并分析对中文开发者的实际价值。
-
禁止开源AI将是重大错误:教育、创新与竞争需要开放
本文分析美国监管开源AI的潜在风险,指出开源在软件生态中占90%以上,创造8万亿美元经济价值。开源AI促进教育、创新和竞争,且更安全透明。对中文圈用户,开源AI提供了不受限制的模型选择,但需关注国产替代和合规问题。
-
Adobe Marketing Agent 接入 Amazon Quick:用自然语言查询营销洞察,加速广告活动工作流
AWS 发布教程,通过 Model Context Protocol (MCP) 将 Adobe Marketing Agent 集成到 Amazon Quick,营销人员可用自然语言查询受众排名、忠诚度分析、旅程冲突等洞察。本文详解配置步骤、权限控制与治理要求,并分析对中文营销团队的实用价值与替代方案。
-
Amazon Bedrock AgentCore 上线 Web Search 功能,让 AI Agent 实时获取网络信息
AWS 宣布 Amazon Bedrock AgentCore 的 Web Search 功能正式可用。该功能基于亚马逊自建网页索引,支持实时搜索,查询不离开 AWS 基础设施,兼容 MCP 协议,几行代码即可集成,解决 AI Agent 知识陈旧问题。
-
新基准测试揭示AI在真实知识工作中表现糟糕,最佳模型仅完成3%任务
一项名为GAIA的新基准测试显示,即使最先进的AI模型在真实知识工作场景中也表现不佳,完全解决率仅3%。本文解读测试细节、对中文用户的影响及国产模型的差距。
-
SAP与Google Cloud联合部署智能体商务架构,自动化企业级营销与零售运营
SAP和Google Cloud推出智能体商务架构,通过Universal Commerce Protocol标准化数据交换,结合Gemini模型实现多智能体自动化营销和零售。文章解析架构细节、对中文企业用户的应用价值及与国产ERP/云平台的对比。
-
路透报告:每周用AI聊天机器人获取新闻的用户增至10%,但信任度仍低
路透社2026年数字新闻报告显示,全球每周使用AI聊天机器人获取新闻的用户比例从7%升至10%,但仅4%会点击原始来源。本文分析这一趋势对中文圈用户获取新闻的影响及信任问题。
-
Google DeepMind再失大将:诺贝尔奖得主John Jumper跳槽Anthropic,AI人才争夺白热化
继Gemini联合负责人Noam Shazeer离职后,诺贝尔化学奖得主、AlphaFold核心开发者John Jumper离开Google DeepMind加入Anthropic。本文梳理事件经过,分析对全球AI竞争格局的影响,并探讨中文圈用户与国产AI厂商面临的机遇与挑战。
-
挪威禁止小学使用生成式AI工具,保护儿童基础学习能力
挪威宣布从2026年8月底起,小学1-7年级全面禁止生成式AI工具,中学仅限监督下使用。首相强调儿童必须先掌握读写算。本文分析政策细节、背后原因及对中国教育AI应用的启示。
-
VibeThinker-3B发布:3B参数推理模型性能媲美671B DeepSeek V3.2,开源MIT协议
新浪微博团队推出VibeThinker-3B,基于Qwen2.5-Coder-3B后训练,在AIME26数学基准上达到94.3分,与671B的DeepSeek V3.2持平。模型采用Spectrum-to-Signal后训练流水线,支持单GPU部署,MIT开源协议。本文详解其技术细节、基准成绩及对中文开发者的实际价值。
-
NVIDIA SpatialClaw 发布:无需训练,用代码作为动作接口实现 3D 空间推理
NVIDIA 推出 SpatialClaw,一种无需训练的智能体框架,通过将代码作为动作接口,在 20 个基准测试中平均准确率达 59.9%,超越 SpaceTools 11.2 个百分点。本文详解其工作原理、性能对比及对中文开发者的实际意义。
-
MCP的真正价值:将认证流程隔离出Agent上下文窗口,Sean Lynch观点
Hacker News用户Sean Lynch指出,MCP协议相比skills/CLI的核心优势在于将认证流程隔离出Agent的上下文窗口,甚至完全脱离执行框架。本文解读这一观点,并分析对中文开发者和AI应用生态的启示。
-
GLM-5.2 开源:753B 参数、百万 token 上下文,登顶开源模型性能榜
智谱旗下 Z.ai 发布 GLM-5.2,MIT 许可开源,753B 参数 MoE 架构,百万 token 上下文窗口。在 Artificial Analysis 智能指数上超越 MiniMax-M3、DeepSeek V4 Pro 等,成为最强开源文本模型。
-
NVIDIA SkillSpector 教程:用静态分析和 SARIF 报告扫描 AI 技能安全风险
了解如何使用 NVIDIA SkillSpector 对 AI 技能进行安全扫描,包括构建良性/恶意技能语料库、运行 LangGraph 工作流、生成 SARIF 报告。本文提供完整代码示例,帮助开发者在部署前识别代码执行、提示注入等风险。