DeepSeek V4 Pro正式版突袭上线:Agent能力跃升,Harness框架即将登场

🤖 由 文心大模型 生成的文章摘要

DeepSeek官网悄然发布DeepSeek V4 Pro 0813正式版。在预览版问世111天后,新模型API价格维持不变(输入3元/百万token,输出6元/百万token),但Agent能力实现质的飞跃,多项基准测试成绩直逼行业标杆Fable 5。

得益于后训练优化,V4 Pro在Agent相关评测中表现惊人:软件工程测试DeepSWE从12.8分飙升至62.7分(+390%),全栈开发困难集DSBench-Hard从31.1分提升至67.2分(+116%),自然语言生成代码仓库NL2Repo从38.5分跃至61.5分(+60%)。在HLE、Terminal Bench等多项评测中,模型表现已接近KIMI K3、Opus-4.8等第一梯队。

媒体实测显示,模型具备出色的自主规划能力:在模糊指令下,能主动调用阅读数据生成带品牌配色的报表;自主搜集科技新闻并生成仿传统媒体风格的网页;甚至从用户读书记录中获取灵感,开发出椋鸟群模拟器等交互应用。模型已能将模糊需求转化为清晰方案并分步执行。

报道指出,V4 Pro的发布可能只是前奏。官方在V4 Flash更新中曾提及使用即将发布的DeepSeek Harness极简模式进行测试。Harness是AI Agent的运行框架,相当于给AI大脑配备的“办公系统”,负责权限管理、工具调度与流程审批——没有好框架,模型潜力无法充分发挥。

近期,DeepSeek已招聘Harness研发工程师,并注册了相关公众号。种种迹象显示,DeepSeek Harness有望在数天至数月内正式亮相,这可能预示着“新的DeepSeek时刻”即将到来。