AI 快讯 · 第 49 页
-
OpenAI 发布 LifeSciBench:750 项真实科研任务评测 AI,专家编写评分标准,最强模型仅通过 36%
OpenAI 推出 LifeSciBench,包含 750 个由 173 位博士科学家编写的真实生命科学研究任务,覆盖 7 大工作流和 7 个生物领域。评测采用 19020 条专家评分标准,而非简单答案比对。当前最强模型 GPT-Rosalind 通过率仅 36.1%,揭示 AI 在科研推理、工具使用和精确输出上的巨大差距。
-
Noam Shazeer 离开 Google 加入 OpenAI,AI 人才争夺战再升级
《Attention Is All You Need》合著者、Google Gemini 模型联合负责人 Noam Shazeer 在重返 Google 仅两年后加入 OpenAI。这是继 Karpathy 跳槽 Anthropic 后今年第二次重大 AI 人才变动,凸显顶级人才在巨头间的激烈流动。
-
微软成OpenAI模型在华唯一供应商,字节跳动年支出超10亿美元
微软通过Azure向中国互联网巨头销售OpenAI模型,字节跳动、蚂蚁集团、美团、腾讯均为客户,而OpenAI和Anthropic因知识产权和滥用风险拒绝直接入华。本文分析微软的中间人角色、模型蒸馏风险及对中文用户的影响。
-
KV Cache压缩竞赛:TurboQuant、OSCAR与EpiCache三大方案对比解析
长上下文LLM的KV cache内存瓶颈日益严重,TurboQuant、OSCAR和EpiCache分别从理论最优量化、可部署INT2压缩和对话记忆管理三个方向给出解决方案。本文详解三者原理、性能差异及互补性,帮助中文开发者选择适合自身场景的压缩策略。
-
HSBC与Google Cloud达成多年AI合作,覆盖财富管理、金融犯罪检测等200+用例
HSBC与Google Cloud签署多年协议,利用Gemini模型和Agent平台在财富管理、金融犯罪检测等领域部署AI。预计两年内支持200+用例,部分项目可带来超1亿美元收益。对中文圈用户,关注外资银行AI应用趋势及国内银行AI布局对比。
-
Adobe 在 Photoshop、Premiere 等 Creative Cloud 应用中集成 AI Agent,支持自然语言指令完成多步骤创作
Adobe 将“创意代理”AI Agent 引入 Photoshop、Premiere Pro 等核心应用,并开放至 ChatGPT 和 Claude 等第三方平台。用户只需描述需求,软件自动执行多步骤工作流,大幅提升创作效率。本文详解功能细节、可用性及对中文用户的实际影响。
-
Midjourney 跨界推出全身超声扫描仪,并开设自营水疗中心
AI 图像生成公司 Midjourney 出人意料地进军医疗健康领域,推出全身超声扫描仪,并在旧金山开设水疗中心。本文解读这一跨界动作背后的技术逻辑、商业模式,以及对中文圈用户可能带来的影响与启示。
-
Yann LeCun警告OpenAI和Anthropic等AI实验室面临“大泡沫破裂”,成本下降太慢
Meta首席AI科学家Yann LeCun指出,OpenAI、Anthropic等AI实验室运营成本下降不够快,依赖投资者补贴,面临泡沫破裂风险。他同时推广自己的新创公司AMI Labs。本文分析对中文AI圈的影响。
-
Nature两研究:AI诊断媲美医生,但模型老化问题凸显
《自然》杂志最新研究显示,专用AI系统在模拟病例中诊断和治疗决策能力与医生相当甚至更优。但两项研究均基于已过时的基础模型,引发对AI医疗模型快速迭代与长期可靠性的讨论。
-
计算机视觉部署推动零售业生产力提升,货架数字化成关键
计算机视觉部署正推动零售业生产力提升,通过自动化货架追踪保护利润率。Coresight Research研究显示,运营低效消耗6.4%的销售额,2026年损失达1964亿美元。本文分析部署现状、技术栈顺序问题及对中文零售商的启示。
-
《粉雄救兵》Karamo Brown 推 AI 克隆体健康应用 Kē,提供个性化生活指导
Netflix 真人秀明星 Karamo Brown 发布健康应用 Kē,内含其 AI 数字克隆体,可提供健身、冥想、戒酒等个性化指导。本文详解功能、定价及对中文圈用户的实用价值。
-
Amazon Bedrock AgentCore Harness 正式可用:两行 API 调用即可构建生产级 AI Agent
AWS 宣布 Amazon Bedrock AgentCore Harness 正式可用,只需两个 API 调用即可创建并运行生产级 AI Agent。它提供隔离环境、内置记忆、多模型切换、工具集成和自动追踪,大幅降低 Agent 开发与部署的工程成本。本文详解其核心能力及对中文开发者的实际意义。
-
Google Deepmind 将 AI 智能体视为内部威胁:新安全路线图按能力分级管控
Google Deepmind 发布“AI 控制路线图”,将 AI 智能体安全措施与可衡量的能力挂钩。分析百万次编码任务发现,多数问题源于过度热情的智能体而非恶意。Deepmind 警告全球安全标准窗口期正在关闭。本文解读对中文用户的影响与启示。
-
Anthropic 将 Artifacts 引入 Claude Code,团队可共享实时交互页面
Anthropic 为 Claude Code 新增 Artifacts 功能,可将编码会话结果转化为实时更新的交互式网页,支持团队共享和版本历史。本文解读该更新对中文开发者的实际意义,包括使用门槛、与国产工具的对比及协作场景影响。
-
ChatGPT医疗升级:GPT-5.5 Instant在准确性上超越医生,错误率降低71%
OpenAI推出GPT-5.5 Instant,升级ChatGPT医疗能力。内部测试显示,模型在准确性、清晰度和完整性上超越医生回答,健康相关错误率降低71%。了解这对中文用户意味着什么。
-
Perplexity 发布 Brain:为 AI Agent 构建自改进工作记忆系统,夜间学习提升正确率 25%
Perplexity 推出 Brain,一种自改进记忆系统,专注于记录 AI Agent 的工作过程而非用户偏好。它构建可追溯的上下文图谱,夜间自动优化,使任务正确率提升 25%、召回率提高 16%、成本降低 13%。本文详解其原理、性能数据及对中文用户的实际意义。
-
Amazon SageMaker 推出 100+ 详细推理指标和 CloudWatch Insights 仪表盘,助力生成式 AI 监控与调试
AWS 为 SageMaker 推理端点新增 100 多项详细指标,涵盖 GPU 健康、token 延迟、KV 缓存压力等,并内置 CloudWatch Insights 仪表盘。本文详解如何开启、使用这些功能,以及对中国用户监控 LLM 推理的实际意义。
-
xFormers 教程:用 Packed Sequences、GQA、ALiBi、SwiGLU 构建内存高效 Transformer
本文详细讲解如何使用 xFormers 实现内存高效的 Transformer 模型,涵盖 packed sequences、grouped-query attention、ALiBi 位置偏置和 SwiGLU 等关键技术,并提供完整代码示例。适合希望优化模型训练和推理性能的开发者。
-
OpenAI 推出 Deployment Simulation:通过模拟部署提前评估智能编码 Agent 安全风险
OpenAI 发布 Deployment Simulation 方法,在模型上线前通过回放历史对话预测不良行为频率,中位误差仅 1.5 倍。本文详解其原理、与传统评估的差异、对 Agent 工具调用的扩展,以及中文用户如何理解这一安全新范式。
-
Datasette 1.0a34 发布:新增行级插入、编辑和删除功能
Datasette 1.0a34 alpha 版本上线,终于支持在网页界面直接插入、编辑和删除数据库行。这一功能受 Datasette Agent 聊天写 SQL 的启发,补上了长期缺失的交互短板。