AI 快讯 · 第 31 页
-
Datalab Lift 9B模型评测:Schema优先的文档提取工具与NuExtract3、LlamaExtract等对比
Datalab推出9B参数Lift模型,直接根据JSON Schema从PDF/图片提取结构化数据,无需先转Markdown。本文对比NuExtract3、Gemini Flash、Azure等工具,分析准确率、延迟、自部署优势,并探讨中文用户的实际应用场景与国产替代方案。
-
Google AI Studio 新增从 GitHub 导入功能,一键将代码仓库转为可部署应用
Google AI Studio 在 Build 模式中推出“从 GitHub 导入”功能,可将现有代码仓库自动转换为运行时兼容格式,支持迭代和部署。本文详解导入流程、API 密钥安全建议及中文用户使用场景。
-
NVIDIA 发布 Nemotron-Labs-3-Puzzle-75B-A9B:压缩混合 MoE 模型,吞吐量提升 2 倍
NVIDIA 推出 Nemotron-Labs-3-Puzzle-75B-A9B,一种压缩版混合 MoE 模型。通过迭代式结构压缩与知识蒸馏,总参数量从 120.7B 降至 75.3B,在 8×B200 节点上实现 2.03 倍服务器吞吐量,单 H100 可并发处理 8 个 1M token 请求。了解其技术细节、性能表现及对中文用户的潜在影响。
-
NHS 将用 AI 血液检测减少侵入性子宫癌检查,每年或惠及 1.8 万女性
英国 NHS 多家医院将引入 PinPoint 开发的 AI 血液检测,通过分析 30 种血液标志物评估子宫癌风险,准确率超 99%。该检测可让约五分之一转诊女性免于阴道超声等侵入性检查,每年涉及约 1.8 万人。
-
OpenAI AI 在顶级编程竞赛 AtCoder 中击败所有人类选手,五题全解
在 2026 年 AtCoder World Tour Finals 中,OpenAI 系统在算法组表演赛里解决全部五道题,其中两道被专家评为极难。本文分析事件细节、技术意义,以及对中文编程竞赛圈和 AI 编程工具用户的启示。
-
OpenAI 发现热门 AI 编程测试 SWE-Bench Pro 约 30% 任务存在缺陷,撤回此前认可
OpenAI 审查了广泛使用的 AI 编程能力测试 SWE-Bench Pro,发现约 30% 的任务存在缺陷,并撤回此前对该基准的认可。这一发现引发对 AI 编程评测可靠性的讨论,对国内模型评测标准制定有参考意义。
-
AWS GraphRAG 部署将药物研发周期缩短 87%,知识图谱与 Claude 4.5 驱动
AWS 利用 GraphRAG 框架整合制药企业分散的数据库,将研发周期从 6 个月降至 3 周,成功率提升至 87%。本文详解其技术架构、成本与中文用户可借鉴的落地路径。
-
Meta 发布 Muse Spark 1.1:首个提供 API 的 Spark 模型,强化 agentic tool calling 与 computer
Meta 推出 Muse Spark 1.1,这是 Spark 系列首个提供 API 的模型,在 agentic tool calling 和 computer use 上有显著改进。本文介绍新模型亮点、如何通过 LLM 工具在命令行使用,以及中文用户如何接入、与国产模型的对比。
-
Amazon SageMaker HyperPod 新增数据捕获、Hugging Face 直连、NVMe 加速等企业级推理功能
AWS 为 SageMaker HyperPod 推出五项新能力:多层级推理数据捕获、从 Hugging Face Hub 直接部署模型、本地 NVMe 加载加速冷启动、自动 Route 53 DNS 管理以及 Pod 级 IAM 权限控制。本文详解这些功能如何提升企业级推理的可观测性、性能和安全性。
-
MCP工具设计实践:避免上下文膨胀与模型混淆的工程方法
AWS博客深入探讨MCP工具设计中的两大问题:上下文膨胀和模型混淆,并提供描述优化、模式约束、工具拆分、懒加载、服务端推理等实用方法。适合AI应用开发者、MCP工具构建者了解如何提升Agent工具性能。
-
GPT-5.6 Sol 综合基准测试仅差 Fable 5 一分,成本仅三分之一
OpenAI 最新模型 GPT-5.6 Sol 在 Artificial Analysis Intelligence Index 上获得 59 分,仅比 Claude Fable 5 低 1 分,但每次任务成本仅 $1.04,是 Anthropic 旗舰模型的三分之一。在 agentic coding 任务中,Sol 击败所有竞争对手,给 Anthropic 带来更大定价压力。
-
NVIDIA 发布 Nemotron-Labs-3-Puzzle-75B-A9B:压缩混合 MoE 模型,吞吐量提升 2 倍
NVIDIA 推出 Nemotron-3-Super 的压缩版 Puzzle-75B-A9B,总参数量从 120.7B 降至 75.3B,活跃参数从 12.8B 降至 9.3B。在单节点 8x B200 上吞吐量提升 2.03 倍,单卡 H100 上 1M token 并发从 1 请求增至 8 请求。本文详解压缩技术、性能数据和部署要点。
-
NVIDIA NeMo 合成数据生成:破解金融 AI 研究数据稀缺难题
NVIDIA 发布基于 NeMo 的合成数据生成方案,用于金融 NLP 模型微调。通过生成稀缺事件(如信用评级变化、产品审批)的文本数据,解决真实金融数据不平衡问题。本文详解技术原理、中文用户应用场景及国产替代方案。
-
OpenAI 发布 GPT-5.6 三款模型 Luna、Terra、Sol,性能与成本优势显著
OpenAI 推出 GPT-5.6 系列,包括 Luna、Terra、Sol 三款模型,主打长时 agent 任务性能,在 Agents' Last Exam 上超越 Claude Fable 5,且成本更低。本文详解定价、基准测试及对中文用户的实际影响。
-
OpenAI 发布 GPT-5.6 三档模型家族:Sol/Terra/Luna,新增 Programmatic Tool Calling
OpenAI 于 2026 年 7 月 9 日正式发布 GPT-5.6 系列,包含 Sol、Terra、Luna 三个档次,定价 $1-$5/百万 token。旗舰 Sol 在编码智能指数上超越 Claude Fable 5,并引入 Programmatic Tool Calling 功能,可在隔离 V8 运行时执行模型生成的 JavaScript,大幅减少 token 消耗。本文详解性…
-
Meta发布Muse Spark 1.1多模态推理模型:百万token上下文、工具调用领先,API已开放预览
Meta Superintelligence Labs于2026年7月9日发布Muse Spark 1.1,这是一款专为智能体任务设计的多模态推理模型,拥有100万token上下文窗口并支持主动压缩。同时Meta Model API公开预览,定价$1.25/百万输入token。本文解析其性能、定价及对中文开发者的实际意义。
-
NVIDIA 发布 Audex 统一音频文本大模型:保留文本智能的 MoE 模型,支持语音识别、翻译与音频生成
NVIDIA 推出 Audex(Nemotron-Labs-Audex-30B-A3B),一个统一处理音频理解、语音识别、翻译、TTS 和音频生成的 MoE 大模型。它基于 Nemotron-Cascade-2 骨干,在文本基准上几乎无退化,同时支持 1M token 上下文。本文详解其设计、训练策略、性能对比及中文用户的实际应用场景。
-
蚂蚁集团 Robbyant 开源 LingBot-Vision:1B 参数边界中心视觉模型,密集空间感知性能超 7B 模型
蚂蚁集团旗下 Robbyant 开源了自监督视觉 Transformer 系列 LingBot-Vision,采用掩码边界建模,将图像边界作为原生训练信号。1B 参数旗舰模型在深度估计、语义分割等密集空间任务上超越 7B DINOv3,并驱动深度补全模型 LingBot-Depth 2.0。本文详解技术原理、性能对比及中文用户如何上手。
-
NVIDIA Cosmos-Framework教程:用Colab搭建Omnimodal MoT世界模型迷你版
本教程从Colab硬件限制出发,基于NVIDIA Cosmos-Framework真实结构,构建并训练一个紧凑的Omnimodal Mixture-of-Transformers世界模型。适合想理解多模态世界模型原理但缺乏高端GPU的开发者。
-
GPT-5.6周四发布,美国政府解禁后OpenAI Sol模型性能超Claude 5成本减半
OpenAI GPT-5.6(代号Sol)将于周四正式上线,此前因美国政府额外测试要求延迟发布。Sol在编程基准上超越Anthropic Claude Mythos 5,成本降低约50%。了解Sol模型对中文开发者的实际影响、国内替代方案及合规注意事项。