AI 快讯 · 第 15 页
-
smevals:轻量级模型评估套件,用 YAML 定义测试并对比 GPT-5.5 与 Claude Opus 4.6 等模型表现
smevals 是 Prime Radiant 推出的开源评估工具,支持用 YAML 定义测试套件,一键运行于多个模型(如 GPT-5.5、Claude Opus 4.6)并自动评分。本文详解其用法、示例(俳句生成评估)及对中文开发者的实用价值,包括本地部署与国产模型适配建议。
-
NVIDIA 提出 AI 模型协同设计:优化注意力机制,加速长上下文推理
NVIDIA 提出 AI 模型协同设计理念,通过调整模型架构以匹配 GPU 执行方式,优化注意力机制,显著提升长上下文推理速度。本文解析其技术细节,并探讨对国内开发者及中文用户的实际影响与替代方案。
-
DeepSeek-V4-Flash-0731发布:Agentic与编程能力大幅提升,API公测开启
DeepSeek发布V4-Flash-0731,架构不变但通过重新后训练大幅提升Agentic和编程能力,API进入公测,价格仅为V4-Pro的三分之一。本文解析升级细节、性能对比及对国内开发者的部署建议。
-
无状态MCP重燃兴趣:MCP 2.0规范发布,简化客户端与服务器实现
MCP 2.0(无状态MCP)规范发布,大幅简化协议实现复杂度。本文解析其与有状态MCP的区别、对AI代理安全性的提升,以及中文开发者如何利用新规范快速构建工具。
-
月之暗面开源MoonEP:专为MoE训练设计的完美均衡专家并行库
月之暗面在Kimi K3开放日开源了MoonEP,一个基于MIT协议的专家并行通信库,用于提升MoE模型训练和推理的扩展效率。MoonEP通过动态冗余专家实现完美负载均衡,号称将Kimi K3的扩展效率提升2.5倍。本文详解其核心设计、与DeepEP v2的对比,以及对中文AI开发者的实际意义。
-
Token Saver 开源 MCP 扩展:本地混合 RAG 将 Claude PDF 处理 Token 成本降低 90-99%
Marktechpost AI 发布 Token Saver,一款开源 MCP 扩展,通过本地混合 RAG 技术,在 Claude Desktop 中处理 PDF 时节省高达 99% 的 Token,同时确保文档隐私。无需上传文件,设置简单,适合处理法律、金融等大型文档。
-
OpenAI称GPT-5.6 Sol在定制测试中超越Anthropic Opus 5,ARC-AGI-3得分38.3%
OpenAI声称其GPT-5.6 Sol模型在ARC-AGI-3基准测试中得分38.3%,超越Anthropic Opus 5的30.2%,但该成绩仅在其自定义API环境下实现,官方测试中仅得7.8%。本文解析争议细节及对中文用户的影响。
-
OpenAI 称 GPT-5.6 Sol 在 ARC-AGI-3 上超越 Opus 5,但测试设置引发争议
OpenAI 声称其 GPT-5.6 Sol 模型在 ARC-AGI-3 基准测试中得分 38.3%,超过 Anthropic 的 Opus 5。但该成绩使用了 OpenAI 自有 API 和额外设置,而非官方测试环境,引发公平性争议。了解测试细节、争议焦点及对中文用户的影响。
-
腾讯开源AngelSpec:统一训练框架加速Hy3模型推理,DFly草案模型实现1.98-2.40倍加速
腾讯开源AngelSpec,一个基于PyTorch的投机解码草案模型训练框架,支持MTP和块并行架构。其核心DFly草案模型在Hy3-295B-A21B上实现1.98-2.40倍推理加速,通过混合目标条件化和隐藏校正自回归头提升接受长度。本文详解技术细节、中文用户可用性及国产替代方案。
-
AI 如何改变企业 Linux VPS 安全:从被动防御到主动检测
AI 正重塑 Linux VPS 安全,通过行为分析、异常检测和自动化响应,帮助中小企业更快发现威胁。本文解析 AI 在服务器安全中的实际应用、与基础防护的关系,以及中文用户如何落地。
-
扎克伯格阐述Meta个人超级智能战略:AI应惠及每个人,而非少数机构
Meta CEO扎克伯格在WSJ发文,提出“个人超级智能”愿景,主张AI应广泛分布以赋能个人,而非集中在少数机构手中。文章批评行业悲观论调,强调个体赋权、发明创造和权力平衡三大原则,但对具体产品、定价和治理细节未作说明。本文解读该战略对中文圈用户的意义。
-
FCC禁止进口中国新机器人及电源逆变器,保护美国AI基础设施免受外国威胁
美国联邦通信委员会(FCC)宣布禁止进口中国制造的新型人形机器人、机器狗,以及电源逆变器,理由是为保护美国AI基础设施建设免受外国威胁。禁令范围广泛,甚至包括扫地机器人、割草机器人和送货机器人。对中国机器人厂商和消费者有何影响?本文解读。
-
微软AI押注廉价专用模型,放弃前沿通用大模型竞争,转向编排软件
微软AI CEO Mustafa Suleyman表示,公司将专注于小型专用模型而非昂贵通用模型。其MAI-Cyber-1-Flash在网络安全基准测试中领先,成本仅为Anthropic Mythos的一半,但复杂任务仍需依赖OpenAI。竞争焦点正从模型本身转向编排软件。
-
Google DeepMind论文:LLM无法引发科学革命,但世界模型可以
Google DeepMind研究员Tom Zahavy在论文《LLMs can't jump》中提出,语言模型缺乏创造全新知识的认知机制,无法引发科学革命。世界模型(world models)可能是突破方向。本文解读核心观点及对中文AI社区的启示。
-
AWS 推出 SageMaker AI 推理元监控方案,用 Quick 构建模型治理层
AWS 发布基于 Amazon Quick 的推理元监控系统,为 SageMaker AI 端点提供持续预测质量跟踪、数据漂移检测、延迟真实标签集成和自动化仪表盘。本文详解架构设计与实现,并探讨对中文圈 MLOps 实践的启示。
-
OpenAI GPT-5.6 三款模型登陆 Amazon Bedrock,显式提示缓存可降低 90% 推理成本
OpenAI GPT-5.6 Sol、Terra、Luna 已在 Amazon Bedrock 上正式可用,并支持显式提示缓存,可精确控制缓存内容,缓存读取成本降低 90%。本文介绍如何上手、设置缓存及迁移现有工作负载。
-
Amazon Bedrock 推出 Advanced Prompt Optimization,一键优化提示词并迁移模型
AWS 发布 Advanced Prompt Optimization,支持同时优化最多 5 个模型的提示词,并对比质量、延迟和成本。本文详解其工作原理、三种评估模式及使用方法,帮助开发者快速迁移模型或优化现有提示词。
-
NVIDIA Exemplar Cloud 揭示:相同 H100/GB200 集群性能差距可达 12%,优化配置是关键
NVIDIA 发布 Exemplar Cloud 项目,揭示即使相同硬件(H100、GB200 NVL72、GB300 NVL72)的 AI 集群,因配置差异训练吞吐量可差 8%-12%。文章总结性能瓶颈根因及优化经验,对国内 AI 基础设施运维、模型训练效率提升有直接参考价值。
-
Yahoo 用 Amazon Bedrock 升级搜索重定向广告,关键词扩展率提升 600 倍
Yahoo DSP 通过 Amazon Bedrock 和 Claude 3.5 Sonnet v2 改造搜索重定向(SRT)关键词扩展,解决传统 Word2Vec 方法词汇陈旧、语义不足问题。新系统将关键词扩展率提升 600 倍,可触达受众增长 5 倍,并引入相似度过滤和敏感词护栏确保质量。
-
月之暗面Kimi K3部署指南:在AWS上运行2.8万亿参数MoE模型
月之暗面于2026年7月发布Kimi K3,一个2.8万亿参数的MoE模型,支持1M token上下文和原生多模态。本文详解如何在AWS上通过SageMaker HyperPod或EKS部署该模型,包括基础设施要求、容量获取和配置步骤。