AI 快讯 · 第 46 页
-
NVIDIA Canary-1B-v2 教程:Python 实现多语言语音识别、翻译与自动 SRT 字幕导出
本文详细教程教你用 Python 和 NVIDIA Canary-1B-v2 搭建多语言 ASR 与语音翻译管道,支持英、法、德、西、意等 25 种语言,可自动生成带时间戳的 SRT 字幕文件,适合视频翻译、会议记录等场景。
-
Datalab 发布 lift:9B 开源视觉模型,根据 JSON Schema 从 PDF 提取结构化数据
Datalab 推出 lift,一个 9B 参数的开源视觉模型,能根据 JSON Schema 从 PDF 和图片中提取结构化 JSON。采用 schema-constrained decoding 和训练式弃权机制,在 225 文档基准上达到 90.2% 字段准确率,支持本地和 vLLM 部署。本文详解其技术原理、基准表现及中文用户适用场景。
-
OPFS + Pyodide 测试工具:在浏览器中持久化编辑 SQLite 数据库
Simon Willison 发布了一个 OPFS + Pyodide 测试工具,探索在浏览器中通过 WebAssembly 运行 Python 应用并持久化编辑本地 SQLite 文件的可能性。对 Datasette Lite 用户和 Web 开发者有重要参考价值。
-
Datasette 1.0a35 发布:新增创建/修改表界面和 JSON API,模板上下文文档化
Datasette 1.0a35 版本上线,带来创建表、修改表的图形界面和 JSON API,支持列定义、主键、外键等操作。同时模板上下文文档正式发布,为自定义模板提供稳定 API。对中文用户而言,这意味着可以更便捷地管理 SQLite 数据库,无需写 SQL。
-
Mistral OCR 4发布:结构化文档输出赋能RAG与Agentic搜索,支持170种语言
Mistral AI于2026年6月23日发布OCR 4,从纯文本提取升级为结构化文档输出,返回边界框、块分类和置信度分数。支持170种语言,单容器自托管部署,定价$4/千页。本文详解其技术细节、基准表现及对中文用户的应用价值。
-
Prefab 教程:用 Python 构建交互式仪表盘并导出静态 HTML,无需前端代码
本文介绍如何使用 Prefab 组件库在 Python 中构建响应式仪表盘,包含图表、表格、筛选器等,并导出为静态 HTML 在 Colab 中预览。适合数据科学家快速创建可交互的数据面板。
-
MoonMath AI 开源 HIP 注意力内核,AMD MI300X 性能全面超越 AITER v3
MoonMath AI 开源了一个针对 AMD MI300X GPU 的 bf16 前向注意力内核,采用 HIP 编写,MIT 许可。该内核在每种形状和舍入模式下均超越 AMD 官方 AITER v3,几何平均加速比达 1.18×/1.15×/1.08×,最高 1.26×。其核心技巧包括单指令内联汇编包装器和八波流水线,通过优化内存布局(K 在 LDS、V 在 L1、Q 在寄存器)实现性…
-
Sakana AI发布Fugu系统:动态编排多个LLM,性能媲美Anthropic Fable 5
日本AI初创公司Sakana AI推出Fugu系统,通过动态协调多个大语言模型,在基准测试中达到与Anthropic Fable 5相当的水平。本文详解Fugu的工作原理、性能表现,并分析其对中文用户的实际意义与国产替代可能性。
-
三星在韩国全员部署ChatGPT Enterprise和Codex,DX部门全球覆盖
三星电子正式向韩国全体员工及全球DX部门员工推出ChatGPT Enterprise和Codex,用于提升办公与开发效率。了解部署范围、企业级功能及对国内用户的启示。
-
欧莱雅将美宝莲虚拟试妆引入ChatGPT,合作覆盖广告、研发与内部AI工具
欧莱雅在VivaTech 2026宣布与OpenAI合作,将美宝莲虚拟试妆功能带入ChatGPT,同时涉及产品发现、广告试点、皮肤微生物组研究及内部AI平台。ChatGPT拥有超9亿周活用户,此次合作对中文用户的美妆购物体验和国产AI应用有何启示?
-
NVIDIA Halos 机器人全栈功能安全系统发布:为物理 AI 提供安全保障
NVIDIA 发布 Halos 机器人全栈功能安全系统,专为物理 AI 设计,解决机器人在非结构化环境中自主运行的安全问题。本文详解其技术架构、对中文圈开发者与企业的意义,以及国产替代方案对比。
-
Vibecoding 成为软件收购决策关键测试:贝恩用 AI 复制目标产品评估护城河
贝恩公司利用 Vibecoding 快速复制潜在收购目标的软件,以此评估其技术护城河和竞争优势。这种 AI 驱动的复制测试已开始影响具体收购决策,对 SaaS 行业估值和创业公司防御策略产生深远影响。
-
五眼联盟警告:前沿AI模型数月内或将重塑网络攻击能力
五眼情报联盟发布警告,称前沿AI模型可能在数月内具备攻击政府和企业网络的能力。本文解读这一警告背后的技术趋势,并分析对中文网络用户的安全启示。
-
GLM-5.2 开源模型发布:性能逼近闭源前沿,中文开源生态迎来“DeepSeek R1 时刻”
智谱 AI 发布 GLM-5.2 开源模型,社区评测显示其编码和智能体能力媲美 Claude Opus 4.8 和 Fable 5。本文解读模型亮点、中文用户的实际可用性,以及国产开源模型与 OpenAI、Anthropic 的差距正在缩小的趋势。
-
NVIDIA DAQIRI 发布:为高速数据采集场景提供实时 AI 推理能力
NVIDIA 推出 DAQIRI 框架,专为高速数据采集场景设计,能在数据流中实时运行 AI 推理。本文详解 DAQIRI 的核心架构、应用场景,并分析它对中文圈工业、科研用户的实用价值与替代方案。
-
Getty Images与OpenAI达成多年协议,授权照片接入ChatGPT搜索
Getty Images与OpenAI签署多年许可协议,将其授权照片库引入ChatGPT搜索功能。用户可在ChatGPT中直接搜索并引用高质量正版图片,提升AI搜索的视觉内容可信度。了解对内容创作者和中文用户的实际影响。
-
Google DeepMind 与 A24 达成长期 AI 电影制作研究合作,投资 7500 万美元
Google DeepMind 与知名电影工作室 A24 宣布长期研究合作,Google 将投资约 7500 万美元。双方将共同探索 AI 在电影制作中的应用,包括视频生成、后期制作等环节。本文解读合作细节及对中文影视创作者的影响。
-
Sakana AI 发布 Fugu 多智能体模型,降低企业 AI 供应商锁定风险
日本 AI 公司 Sakana AI 推出 Fugu 多智能体编排模型,通过动态路由调用多种模型完成任务,避免单一供应商依赖。标准版和 Ultra 版分别面向日常任务和复杂分析,已在代码审查、网络安全等场景验证,为中文用户提供供应商锁定问题的参考方案。
-
在 Amazon SageMaker 上批量运行 ComfyUI 工作流:自动化生成数百张高质量图片
本文介绍如何将 ComfyUI 工作流部署到 Amazon SageMaker AI 处理任务中,实现数百张图片的批量生成。涵盖 AWS CDK 基础设施搭建、GPU 加速配置和自动化扩展,适合需要大规模内容生成的企业用户。
-
亚马逊多模态AI实现航空影像自然语言搜索:Nova Embeddings 性能最优
AWS 与 Vexcel 合作,利用多模态嵌入、LLM 描述和向量搜索,实现航空影像的自然语言语义搜索。本文详解架构、评估方法及实验结论,包括 Amazon Nova Multimodal Embeddings 在 F1 分数上的领先表现,并给出工程实践建议。