Count Anything模型发布:用文本提示即可精准计数图像中任意物体,错误率减半
Count Anything是首个通过文本提示计数图像中任意物体(从人群到细胞样本)的AI模型,在对比测试中错误率较此前系统降低一半。本文详解其原理、局限及对中文用户的实际价值。
一句话看懂
Count Anything 是首个通过文本提示即可计数任意图像中物体数量的 AI 模型,测试中错误率比此前系统降低一半。
详细发生了什么
2026年6月,一个名为”Count Anything”的新AI模型正式发布。该模型由研究团队开发,旨在解决计算机视觉中的一个长期难题:让AI像人类一样,仅凭一句自然语言指令(如”数一下这张照片里有多少人”)就能准确统计图像中特定物体的数量。
与传统的物体检测加计数方法不同,Count Anything不需要预先训练特定类别,而是通过文本prompt动态理解用户想要计数的对象。在官方公布的对比测试中,Count Anything在多个基准数据集上的平均计数错误率仅为此前最佳系统的50%,尤其在稀疏场景(如少量人群、桌面物品)中表现突出。
不过,该模型目前仍存在明显局限:当图像中物体极度密集(如密密麻麻的细胞样本)或用户使用模糊描述(如”数一下那些东西”)时,准确率会显著下降。团队表示,后续将通过扩大训练数据和改进注意力机制来优化。
中文圈视角
Count Anything 对中文用户的实际价值主要体现在两个场景:
-
科研与医疗:国内高校和医院经常需要统计显微镜下的细胞数量、菌落数量等。此前常用ImageJ等传统工具,需要手动标注或编写脚本。Count Anything的文本prompt方式可以大幅降低操作门槛,但需注意模型目前仅支持英文prompt,中文prompt效果未知,且数据可能需上传至海外服务器,涉及数据出境合规问题。
-
电商与物流:国内仓库盘点、货架商品计数等场景有强烈需求。目前国内已有类似产品如百度飞桨的PP-OCR和华为云ModelArts的物体计数功能,但多依赖定制化训练。Count Anything的零样本能力是差异化优势,但国内用户可能需要通过API调用,存在延迟和成本问题。
一个尚未被中文圈广泛讨论的盲点是:Count Anything的计数能力与多模态大模型(如GPT-4V、Qwen-VL)的计数能力对比如何?后者也能通过对话完成类似任务,但专门化模型在精度和效率上可能更优。
几条值得记住的细节
- Count Anything 是首个通过文本prompt实现任意物体计数的AI模型,无需预训练类别。
- 在对比测试中,错误率仅为此前最佳系统的一半,尤其在稀疏场景表现优异。
- 模型在极度密集物体(如细胞样本)和模糊描述时准确率下降,团队计划后续优化。
- 目前仅支持英文prompt,中文支持情况未知。
- 模型可能通过API提供服务,国内用户需注意数据出境合规。
一句话总结
Count Anything 让图像计数像聊天一样简单,但中文用户需权衡精度、合规与成本。