7800美元颠覆千亿参数格局!微博开源VibeThinker模型,小参数量解锁强推理能力

🤖 由 文心大模型 生成的文章摘要

在AI行业深陷“参数竞赛”的当下,微博人工智能实验室近日重磅开源参数量仅 1.5B(15 亿)的VibeThinker模型,以创新算法打破“大参数即强性能”的行业共识。这款模型凭借独特的“频谱-信号原理”(SSP),在数学推理与编码任务中实现对千亿级大模型的超越,且训练成本仅7800美元,为边缘AI部署与低成本AI研发提供了全新范式。

VibeThinker的性能表现堪称“以小博大”的典范。在三大顶级数学竞赛基准测试中,它全面超越参数量达671B(是其400多倍)的DeepSeek R1:AIME24中取得80.3分,高于DeepSeek R1的79.8分;AIME25中以74.4分逼近456B参数的MiniMax-M1;HMMT25中更是从基础模型的0.6分飙升至50.4分,大幅领先DeepSeek R1的41.7分。

编码任务方面,模型在LiveCodeBench V6基准中斩获51.1分,不仅远超同参数规模模型,还击败了Magistral Medium等更大参数量模型,甚至优于GPT-4.1的44.7分。此外,其推理能力还成功迁移至专业领域,在GPQA Diamond博士级基准测试中,从基础模型的16.4分提升至46.7分,在同参数模型中处于领先水平。

VibeThinker的成功核心在于摒弃了传统训练思路,通过SSP框架实现 “先扩宽、再聚焦” 的协同优化。

该阶段不追求单次正确率,而是通过“两阶段多样性蒸馏”最大化 “多次生成正确答案”的概率。先将复杂任务拆解为代数、几何等子领域,为每个领域筛选出多样性最优的“专家模型”,再通过参数加权融合,让模型储备多维度解题路径,形成覆盖正确答案与合理中间过程的“答案频谱库”。这种策略不仅提升了多样本正确率,还间接强化了单次推理的准确性。

采用创新的“MaxEnt引导的策略优化(MGPO)”,优先聚焦模型能力“边缘地带”的问题 ——即正确概率接近50%的不确定样本。通过二进制分布熵量化不确定性,对高价值样本赋予最高权重,让计算资源集中于效率最优的学习任务,分阶段完成数学推理与编码能力的精准优化。

VibeThinker的训练仅消耗3900个NVIDIA H800 GPU小时,按市场租赁价2美元/小时计算,总成本仅7800美元。这一数字不足DeepSeek R1训练成本(294万美元)的1/30,更是远低于MiniMax-M1的535万美元。

轻量化特性带来了显著的部署优势。1.5B的参数量使其可轻松运行于手机、车载设备等边缘终端,推理成本比千亿级大模型低20-70倍,彻底打破了“强AI只能依赖大型服务器” 的限制,为中小企业及科研团队降低了AI研发与应用的门槛。

「93913原创内容,转载请注明出处」