数说前沿 志在先锋
让每一次刷新都有价值

DeepSeek V4 Pro正式版性能比肩国际顶尖模型 首款Agent框架的Harness开源

8月13日深夜,国产大模型公司深度求索(DeepSeek)迎来密集的技术与产品更新。在正式推出V4-Pro-0813版本的同时,其首款Agent(智能体)基础设施Harness也宣告开源。结合近期公布的中文编程测评数据,DeepSeek正通过底层模型能力的跃升与上层应用框架的拓展,进一步缩小与国际顶尖水平的差距,并持续巩固其在性价比领域的优势。

V4-Pro正式版上线:性能对标Fable 5,定价策略暂未调整

8月13日凌晨,DeepSeek低调上线了V4-Pro-0813正式版。目前,该版本已同步更新至API接口与官方Chat端,开发者可通过原有的deepseek-v4-pro接口直接调用。

在性能表现上,官方公布的跑分数据显示,V4-Pro-0813不仅全面超越了此前的预览版及Flash-0731版本,在与国际顶级大模型的横向对比中也展现出强劲实力。测试结果表明,该版本已稳定超越Anthropic的Opus 4.8,并在多项指标上与OpenAI的Fable 5处于同一梯队,具备了与全球最前沿模型“正面交锋”的能力。

价格方面,V4-Pro-0813目前的API定价仍维持在此前水平,整体约为V4-Flash版本的3倍。尽管官方此前曾多次释放调整API价格的信号,但当前页面尚未引入峰值定价机制,具体的涨价幅度与生效时间仍有待后续正式公告。

编程测评跻身第一梯队:成本仅为头部模型的十四分之一

在模型底层能力提升的同时,DeepSeek在垂直应用场景中的表现也获得了权威评测机构的认可。

根据CLUE团队最新发布的SuperCLUE-Terminal中文智能体终端编程测评榜单,DeepSeek-V4-Pro-0813以51.52分的成绩位列第二,仅次于月之暗面的Kimi-K3(60.61分),并大幅领先于GLM-5.2(48.48分)及老版V4-Flash(46.46分)。

SuperCLUE-Terminal是专门面向国内开发者的实战评测标准,采用本土真实编程任务,并以Claude Code作为统一运行框架,重点考察模型理解中文需求、任务规划、工具调用及代码纠错的完整闭环能力。每道考题需进行50至110轮交互,单题运行时间长达半小时至一个半小时,高度还原了日常开发中的复杂工作流。

在实际测试中,V4-Pro-0813能够完整处理前端页面构建、3D游戏逻辑开发及工程脚本修改等任务,代码结构合理,交互反馈自然。更为关键的是其极致的成本控制:单题调用成本仅为1.42元,约为Kimi-K3的十四分之一、GLM-5.2的十六分之一。对于中小企业和独立开发者而言,这种在性能与开销之间取得的平衡,大幅降低了高阶代码辅助工具的使用门槛。

进军Agent赛道:Harness开源,贯彻“一切皆插件”理念

除了模型本体的迭代,DeepSeek在应用落地层面也迈出了重要一步。8月13日晚间,DeepSeek正式推出首款Agent产品——DeepSeek Harness v0.1开发者预览版,并以MIT协议在GitHub全面开源。

如果说大模型是Agent的“大脑”,那么Harness就是其“四肢”与“神经系统”。官方将其核心逻辑总结为“Model + Harness = Agent”:模型负责思考与推理,Harness则负责实际的执行与调度。该项目内置了项目管理、长周期任务协作、多智能体编排、上下文管理、联网检索及外部技能调用等本地智能体工作台所需的核心能力。

本次Harness的最大亮点在于其“一切皆插件”的架构设计。基于Cordis插件元框架打造,Harness将模型、工具、技能、会话、沙箱、存储、循环、调度及UI等所有Agent能力均抽象为独立插件。开发者无需修改项目源码,即可通过配置层面的自由拼装,实现任意模块的自定义与能力扩展。

为适应不同开发场景,Harness预置了四种运行模式:

标准模式:搭载全套工具组件,满足通用开发需求;

PTC模式:由模型生成代码,编排多轮工具链式调用;

极简模式:仅保留Shell与文件编辑工具,适用于最小环境下的模型基准测试;

创造模式:支持运行时状态查看与内存调试,允许开发者自定义生成全新运行模式。

开发者在本地部署Node.js工具链后,即可通过简单的npx命令快速拉起Web交互界面。作为DeepSeek布局Agent赛道的开源基座,Harness v0.1的发布标志着其正从单一的模型提供商,向提供完整AI应用基础设施的平台演进。

从V4-Pro正式版在通用能力与编程领域的双突破,到Harness开源对Agent生态的底层构建,DeepSeek在短短24小时内完成了一次从“模型能力”到“系统能力”的全面展示。在竞争日益激烈的大模型赛道中,这种坚持技术硬核与极致性价比的路线,正为其赢得更广阔的市场空间。

免责声明:本站仅对网上信息进行整理展示,所发内容不代表本站观点
版权声明:本文采用知识共享 署名4.0国际许可协议 [BY-NC-SA] 进行授权
文章名称:《DeepSeek V4 Pro正式版性能比肩国际顶尖模型 首款Agent框架的Harness开源》
文章链接:https://www.shonline.cn/hot/2026/481.html
分享到