DefiRWA

 找回密码
 立即注册
搜索
热搜: 活动 交友 discuz
查看: 13|回复: 0

DeepSeek V4 Pro+Harness开源:Model+Harness才等于Agent

[复制链接]

1190

主题

1201

帖子

4006

积分

版主

Rank: 7Rank: 7Rank: 7

积分
4006
发表于 2026-8-16 10:17:08 | 显示全部楼层 |阅读模式
8月14日,DeepSeek 同步上线 V4-Pro-0813 正式版与 DeepSeek Harness v0.1 开发者预览版。Harness 以 MIT 协议开源,GitHub 上线不到两天即获超过 9.3 万颗星。这是国内厂商首次把"模型 + 运行框架"作为整体能力发布。


一、V4-Pro 主打 Agent 工作负载

V4-Pro-0813 在 Terminal Bench 2.1 上得分 87.9,DeepSWE 62.7,Toolathlon-Verified 74.1,CyberGym 83.3,公开 AutomationBench 31.8,所有测试均通过 Harness 的 minimal 模式跑出。模型支持低、中、高、max 四档思考强度,可按任务难度调节成本。上下文 100 万 Token、输出 38.4 万 Token,兼容 OpenAI Responses API。8 月 16 日起 API 实行峰谷定价,闲时价格仅为高峰时段的一半。


二、Harness 的核心是"一切皆插件"

DeepSeek 给出公式 Model + Harness = Agent。Harness 把模型、工具、技能、会话、沙箱、存储、循环、调度和 UI 做成可挂载、可替换的独立插件。运行框架提供 Standard、Code、Minimal、Creator 四种模式。独立评测博主 sentdex 实测:同一套 V4-Flash 权重,换成社区完整 Harness 后,89 道题答对从 44 题提升到 64 题。会话日志只追加、可恢复、可分叉、可回放,企业审计与对比 Harness 行为成为可能。


三、企业落地的三条红线

第一,不要裸跑模型权重。V4-Pro 在不同 Harness 下表现差异极大,生产前必须用真实任务做对照实验。第二,模型名虽未变,但 API 计费、上下文窗口和峰值并发已调整,迁移要按新版文档重新压测。第三,Harness 暴露工具调用、文件读写、沙箱和权限接口,攻击面比纯 Chat API 大;高权限操作必须保留审批与回滚点。

DeepSeek 这波释放的真实信号是:Agent 时代的能力竞争已不只看模型跑分,更看 Harness 是否可观测、可审计、可换皮。企业在评估国产模型时,应把"模型"和"运行框架"作为两个独立项目分别尽调。

数据来源:DeepSeek《DeepSeek-V4-Pro-0813 发布说明》,2026-08-14;DeepSeek Harness v0.1 GitHub 仓库与官方博客;新浪科技《DeepSeek Harness:杀死 Agent 黑箱》,2026-08-16。
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

QQ|货物清仓|Archiver|手机版|小黑屋|倒数|舒尔特|好邻卡|RWA+DeFi|融资计划|内购渠道|Github|Web4

GMT+8, 2026-9-5 10:56 , Processed in 0.062004 second(s), 21 queries .

Powered by Discuz! X3.4

Copyright © 2001-2023, Tencent Cloud.