VibeThinker-3B发布:3B参数推理模型性能媲美671B DeepSeek V3.2,开源MIT协议
新浪微博团队推出VibeThinker-3B,基于Qwen2.5-Coder-3B后训练,在AIME26数学基准上达到94.3分,与671B的DeepSeek V3.2持平。模型采用Spectrum-to-Signal后训练流水线,支持单GPU部署,MIT开源协议。本文详解其技术细节、基准成绩及对中文开发者的实际价值。
一句话看懂
新浪微博团队发布VibeThinker-3B,一个3B参数的开源推理模型,在数学和代码基准上性能媲美671B的DeepSeek V3.2,MIT协议可商用。
详细发生了什么
VibeThinker-3B是一个基于Qwen2.5-Coder-3B构建的密集推理模型,由新浪微博(中国)的研究团队开发。它并非从头预训练,而是通过后训练流水线——Spectrum-to-Signal Principle(SSP)——在监督微调(SFT)、强化学习(RL)和自蒸馏后得到。模型专门针对可验证的推理任务(数学、代码、STEM),在开放域知识任务上建议使用更大的通用模型。
基准测试方面,VibeThinker-3B在AIME26上取得94.3分,与DeepSeek V3.2(671B)和Kimi K2.5(1T)相当。在LiveCodeBench v6上达到80.2 Pass@1,在HMMT25上为89.3,BruMO25为93.8,IMO-AnswerBench为76.4。使用测试时扩展方法CLR(Claim-Level Reliability Assessment)后,AIME26提升至97.1,BruMO25达到99.2。在未见的LeetCode周赛/双周赛中,首次提交Python通过率高达96.1%(128题通过123题)。
模型权重约6GB(BF16),可单GPU运行,推荐使用vLLM或SGLang进行推理。代码和权重已在Hugging Face上以MIT协议开源。
中文圈视角
VibeThinker-3B对中文开发者来说有几个直接价值:
-
低成本推理能力:3B参数模型在数学和代码推理上达到千亿级模型水平,意味着个人开发者或小团队可以用一张消费级GPU(如RTX 4090)部署强大的推理助手,无需调用昂贵API。对于需要大量自动解题、代码生成的场景(如在线教育、编程竞赛训练),成本大幅降低。
-
开源可商用:MIT协议允许自由使用、修改和商用,国内企业可以基于此模型开发私有推理服务,无需担心合规风险。相比DeepSeek V3.2(671B,开源但部署成本高),VibeThinker-3B更适合边缘部署或资源受限环境。
-
国产模型生态补充:基于Qwen2.5-Coder-3B,与阿里通义千问生态兼容,方便集成。目前国内类似小参数推理模型较少,VibeThinker-3B填补了空白。但需注意,它在知识密集型基准(如GPQA-Diamond)上落后于大模型,不适合开放域问答。
-
监管友好:模型体积小,数据可控,适合国内数据不出境要求。团队来自新浪微博,属于国内企业,合规风险低。
几条值得记住的细节
- 模型大小:3B参数,BF16权重约6GB,单GPU可运行。
- 基准成绩:AIME26 94.3(+CLR后97.1),LeetCode unseen 96.1%通过率。
- 后训练流水线:Spectrum-to-Signal,包含SFT、多领域RL、自蒸馏和指令RL。
- 测试时扩展:CLR方法无需增加参数,通过多次采样和自验证提升准确率。
- 开源协议:MIT,可商用。权重在Hugging Face上以WeiboAI/VibeThinker-3B发布。
一句话总结
VibeThinker-3B证明小模型也能在推理任务上媲美千亿级模型,对预算有限的中文开发者和企业来说,是一个高性价比的开源选择。