DeepSeek V4 Pro与Harness双发布各方观点
观点组1: Harness的轨迹日志与只追加式事件流设计,首次实现Agent执行全过程可追溯、可回放、可分叉,从根本上解决了长周期任务不可控、不可调试的行业痛点。
观点作者:DeepSeek Harness团队
观点内容:我们构建了仅追加(append-only)的会话日志系统,模型看到的一切——系统提示词、思维链、工具调用与结果、子Agent调度、上下文注入——均按时间戳写入统一事件流;轨迹视图支持按来源筛选、进度恢复、分叉重试与全链路回放,使Agent从黑箱变为透明工作台。
观点作者:崔添翼
观点内容:轨迹设计源自量化交易系统的审计需求:每一笔订单、每一次风控触发、每一毫秒延迟都必须留痕且不可篡改;在Harness中,橙色代表工具调用、绿色代表上下文、蓝色代表模型输出,彩色读条实时映射运行节点,当任务中断时系统自动保存断点并支持续跑,彻底终结‘一断全废’。
观点作者:作者
观点内容:在火星登陆模拟测试中,Harness的轨迹模式清晰展示了AI如何发现缺失识图能力、自主编写插件、安装并调用;这种基于事件流的可观测性,让开发者能像调试分布式系统一样定位Agent瓶颈,是当前所有闭源Agent框架(包括Claude Code)尚未提供的核心工程能力。
观点组2: DeepSeek通过Harness开源与V4 Pro提价双轨策略,主动推动行业从价格战转向‘智力战’,以技术壁垒重构AI商业化逻辑:卖结果而非卖Token。
观点作者:摩根士丹利
观点内容:2026年Q2中国大模型平均API输入价升至4.9元/百万Tokens,输出价达21.9元,同比上涨48%和80%;DeepSeek对V4 Pro引入峰谷定价(高峰输出27元/百万Tokens),并非单纯涨价,而是以价格杠杆引导高价值任务使用优质算力,标志着行业正告别低价倾销,转向能力溢价时代。
观点作者:Composio机构
观点内容:同一DeepSeek V4 Flash模型在不同Harness上执行相同任务,单次成功成本从0.028美元(Pi)到0.195美元(Claude Code)相差近7倍;Harness的缓存策略、工具调用编排与任务循环设计直接决定商业成本,DeepSeek通过开源Harness+高价Pro模型,实质是在销售可验证的Agent生产力。
观点作者:智东西
观点内容:DeepSeek选择‘先文档后公告’的静默发布与峰谷定价,体现其工程导向思维:API服务未中断即代表可用,价格体系则是对算力资源稀缺性的诚实定价;这种将技术确定性置于营销节奏之上的做法,正在倒逼整个行业建立更健康的商业化基准。
观点组3: DeepSeek Harness以‘一切皆插件’架构开创Agent开发新范式,是国产AI在执行层实现自主可控的关键突破。
观点作者:DeepSeek Harness团队
观点内容:我们采用‘一切皆插件’的设计思路,将模型、工具、技能、会话、沙箱、存储、循环、调度、UI等所有Agent能力全部解耦为独立Cordis插件,开发者无需修改源码即可自由替换、组合与扩展;该框架不绑定任何特定模型,已支持接入OpenAI、Anthropic、Google、Kimi等近40家第三方模型,目标是成为AI时代的开源操作系统底座。
观点作者:崔添翼
观点内容:Cordis元框架的核心使命是解决Agent运行时的时空可组合性问题——通过时间可组合性(逆操作保障状态回滚)与空间可组合性(依赖感知的动态插件加载),让系统在不停机前提下完成核心组件热替换;这源于高频交易系统对确定性、可观测性与韧性工程的极致要求,现被完整迁移到Harness中。
观点作者:作者
观点内容:Harness不是DeepSeek版的Claude Code,而是对Agent运行时本质的重新定义:连‘思考-行动’循环本身都可作为插件被替换;它把模型从‘缸中之脑’解放为可装配的智能单元,配合标准/PTC/极简/创造四种预设模式,使开发者能在同一框架内完成从基准测试到自我进化插件开发的全栈实践。
观点组4: DeepSeek V4 Pro正式版标志着中国大模型从‘能回答’迈向‘能干活’,其在网络安全、软件工程等实战型Agent评测中已超越Fable 5,验证了任务导向型能力升级的有效性。
观点作者:DeepSeek官方
观点内容:V4-Pro-0813在CyberGym(网络安全攻防)得分83.3、AutomationBench(业务流程自动化)得分31.8,均位列第一并反超Claude Fable 5;在DeepSWE(复杂软件工程)中得分62.7,较预览版提升近5倍;这些成绩是在Harness框架下实测所得,证明模型能力必须与强执行系统协同释放。
观点作者:开机实验室
观点内容:对比测试显示,V4 Pro在终端操作、代码生成与安全分析等需真实环境交互的任务中表现突出,尤其在CyberGym中以83.3分小幅领先Fable 5(83.1分),而在知识推理类评测HLE上仍存差距;这印证其战略重心已明确转向‘交付结果’而非‘展示智商’。
观点作者:DeepSeek资深研究员陈德里
观点内容:V4 Flash-0731的跑分已在Harness极简模式下完成,而V4 Pro正式版与Harness同步上线构成‘黄金搭档’;我们的Agent能力提升不是参数堆砌的结果,而是模型架构(MoE)、缓存机制(99.93%命中率)与Harness执行效率三者协同优化的产物。