公告
先看证据,再决定买不买

频道每天最多 3 条价格异动与中转状态;具体商品请用机器人设置降价/补货提醒。交流群提问请带预算、模型、工具和使用频率。

查看
社群与联系Telegram 群点击加入Telegram 频道每天最多 3 条有效价格情报联系我们tgAIPricedb交流群979789483
返回资讯列表
product

DeepSeek Harness:SDK 能否成为 AI 产品的数据入口?

DeepSeek Harness 更像一套运行在用户环境中的 Agent 工作台,覆盖 Web、终端、无头模式及 SDK 等入口。它可能扩大真实软件工程任务的使用场景,但现有证据不足以证明会自动形成面向 DeepSeek 的数据飞轮。

72% VERIFIED

现有资料显示,DeepSeek Harness 处于开发者预览阶段,重点是让 Agent 进入代码库、终端和长周期任务。除了可交互界面,它还提供 TUI、Headless、ACP、JSON-RPC 和 Python SDK 等自动化方式,并支持插件、任务编排及多 Agent 协作。SDK 因此可能让 Harness 更容易嵌入企业流程,而不只是作为独立的编程产品存在。

不过,“产品使用—数据—模型升级”的叙事需要谨慎区分推测与事实。相关文档显示,会话可以保存在本地 JSONL 或 SQLite 中,遥测默认关闭;即使启用,数据发送位置也由部署方决定。用户通过其他模型产生的本地轨迹不会自动进入 DeepSeek 服务器,因此不能据此断言 Harness 会持续为 DeepSeek 训练提供完整的真实任务数据。

GLM-5.3 被报道已接入 ZCode 等产品,后训练、工具协同和长任务执行被视为提升模型表现的重要方向。但模型参数、能力提升、数据回流以及收入转化之间仍缺乏独立验证。对资本市场而言,使用量、付费率和利润率仍比单次产品演示更能检验这套商业模式。

来源证据

DeepSeek正式开源Harness:它终于有了自己的Vibe Coding入口_新浪财经_新浪网finance.sina.com.cn · supporting

以官方目前开放的形态来看,DeepSeek Harness 更接近一套运行在用户本地环境里的 Agent 工作台。 它不只给出答案,还可以进入实际工作环境继续行动。比如,用户可以把一个代码项目所在的文件夹交给它,让它先阅读项目结构和文档,再寻找相关代码、修改文件、调用终端运行程序或测试;如果测试报错,它还可以根据错误信息继续定位问题、再次修改,而不是每一步都等用户复制粘贴代码和报错信息。 这些能力主要通过 Web UI 提供,同时还有面向终端用户的TUI、适合脚本和 CI 的 Headless 模式,以及 ACP、JSON-RPC 和 Python SDK 等自动化入口。换句话说,同一套 Harness 既可以做成人直接操作的编程工作台,也可以被接进自动化流程:例如收到一个任务后自动检查代码、执行测试,完成后再返回结果。提前体验资料显示,这些形态共享同一套模型、会话和底层插件,只是通过不同组件组合成不同的产品形态。 它还支持更复杂的长任务和多 Agent 协作。一个主 Agent 可以把工作拆给多个子 Agent,例如让一个负责搜索项目和资料,一个负责修改代码,另一个负责执行测试,再由主 Agent 汇总结果并决定下一步。官方框架同时提供计划、目标、待办事项和后台任务等机制,目的就是让 Agent 不必局限在“一问一答”,而可以持续完成一串彼此关联的操作。 这让 DeepSeek 开始进入 Claude Code、Codex 等产品已经率先展开的竞争。基础模型公司不再满足于提供一个 API,而是进一步争夺模型和真实计算环境之间的执行层。 [...] 这也是为什么,同一个模型放进不同 Harness,实际表现可能出现明显差异。提前体验 DSH 的媒体曾将同一版本 V4 Flash 放入不同 Agent 框架完成相同任务,结果出现了肉眼可见的差异。当然,单次测试无法证明哪种 Harness 普遍更强,但至少说明,工具、提示词、上下文组织和执行策略已经成为 Agent 最终性能的一部分。 过去谈 DeepSeek,竞争焦点几乎始终落在模型本身:参数规模、训练成本、Benchmark 和 API 价格。但到了 V4 Pro 与 DeepSeek Harness,这条边界正在发生变化。 模型仍然决定智能的上限,但当模型开始真正进入代码库、终端和长期任务后,如何把这

deepseek-harness/packages/core/tools/README.zh.md at master · deepseek-ai/deepseek-harness · GitHubgithub.com · supporting

在 `code`(而非 `both`)下,该传输同时也是模型唯一可用的入口:模型直呼其他任何可见工具名,都会在创建执行时、早于 `tools/pre-execute`、审批 `ask` 和 guards 解析为 `UNKNOWN_TOOL`,因此没有任何一方会观察或批准一个注定失败的调用。拒绝信息会给出正确路径(`only \`run\_code` is callable directly — call `` from inside a `run\_code` program instead`),因为同一份提示词刚刚声明过那个工具,只说` unknown tool`会被读成部署损坏。SDK 子分发携带外层执行的`parent`token,不受此限制,因此程序保留 SDK 声明的全部绑定。参见执行器塌缩 note、Code Mode 基础、类型化返回约定和代码运行时 seam。可以运行`pnpm run demo:code-mode` 试用。 [...] ### Code Mode 在 `code` 或 `both` 模式下,注册表为当前作用域公开保留的 `run_code` 传输和按所加载运行时语言生成的确定性 SDK——注册表按 `ctx.codeRuntime.language` 选择渲染器(`typescript` → 下方的 TypeScript SDK,`python` → Python SDK)。只有程序的外层日志与返回值会重新进入模型上下文。SDK 为每个可见工具声明精确的参数与规范输出类型(TypeScript 为 `ToolArgsMap`/`ToolOutputMap`,Python 为具名 `TypedDict`),每个绑定都会解析为该工具的规范 JSON 值。每个无损 JSON 绑定调用都会在原生调度约定下重新进入完整工具流水线(并发安全的调用最多可重叠 `maxParallelSubCalls` 个;独占调用单独运行并构成排序屏障),并在日志中与外层调用建立关联。拒绝及其他失败结果会以程序实际可见的 `ToolCallError` 形式拒绝,且只携带 `toolName` 和 `message`;Native 内容和内部错误码留在 Code 约定之外。普通副作用不会回滚,子调用的 `additionalContexts` 会通过父结果延迟

刚刚,GLM-5.3来了,拿下多个开源SOTA,我用它“魔改”DeepSeek Harness-36氪m.36kr.com · supporting

目前,GLM-5.3已上线智谱的AI编程工具Zcode、效率工具AutoClaw,支持通过GLM Coding Plan使用。同时,这一模型还在TraeWork、_WorkBuddy_、_Qoder_、OpenCode等平台开放了抢先体验。 智谱称,GLM-5.3的API将很快上线。同时,在模型开源之前,GLM-5.3还将完成安全评估、安全加固,以限制其在网安领域的潜在攻击能力,保留其防御价值。 ## 01 拿真实数据1:1复刻外滩建筑群,还做了个开放世界驾驶游戏 此次测试,我们用到了智谱最近更新的ZCode,搭配旗舰模型GLM-5.3。我们交给GLM-5.3的第一个任务是一份有难度的产品需求文档:以真实的OpenStreetMap数据为基础,开发一款上海陆家嘴至外滩区域的3D开放世界驾驶游戏。 文档中要求,地图解析、坐标转换和游戏逻辑等关键模块全部让模型“手写”,只允许使用Three.js的底层渲染能力。为了测试模型在长任务中的记忆可靠性,我们还在文档中部埋下了两条“陷阱条款”,包括凌晨两点到四点外滩建筑灯光熄灭一半,以及地图边缘需要设置带有提示的软性阻挡。 Image 5 GLM-5.3拿到需求后先验证了数据的真实形态。它编写脚本从Overpass API拉取了8万多个OSM节点,先做了一轮数据勘查,确认地图数据的完整性后,才开始开发。 整个开发过程持续了多轮,最终交付了约4900行代码,覆盖数据管线、车辆物理、车辆音效、导航、昼夜循环和存档系统,两条埋雷条款在最终验收中全部通过。 开发过程中,可以观察到GLM-5.3排查问题的思路很清晰。测试早期,游戏页面完全卡死,它没有盲目改动代码,而是给本地服务器加了请求探针,通过面包屑日志定位到问题。 Image 6 [...] 后训练这条路线近期的受益者不止智谱一家:_DeepSeek_-V4正式版能力的大幅提升,同样与后训练阶段的投入有关。在预训练的数据与算力红利逐渐见顶之后,后训练正成为头部模型厂商进一步提升性能的关键方向,其潜力很可能还未被充分挖掘。 本文来自微信公众号 “智东西”(ID:zhidxcom),作者:陈骏达,36氪经授权发布。 该文观点仅代表作者本人,36氪平台仅提供信息存储空间服务。 +1 0 好文章,需要你的鼓励 []( 3_收 藏_+10_评 论_ _打开微信

DeepSeek Harness 发布后,Agent 这门生意变了huxiu.com · supporting

如果 DeepSeek Harness 真的能够形成插件生态,Agent 行业的成本结构也会跟着改变。 一套通过金融机构安全审查的沙箱,可以同时进入银行、保险和证券公司的不同 Agent;一个成熟的企业记忆插件,也可以被法律、医疗和财务产品反复调用。过去藏在每个项目里的重复开发,有机会变成可以多次交付的标准产品。 但是请注意:插件生态越开放,随之而来的管理成本也会越高。 插件可能接触企业数据、调用内部系统,甚至直接执行代码。任何一个插件出现漏洞,都可能拖累整套 Agent。版本升级以后还能不能运行,几个插件互相冲突应该找谁负责,也会成为新的研发成本。 一个成熟的插件生态,迟早需要安全审查、兼容性测试、版本管理和长期维护。否则所谓开放,很容易变成从 GitHub 上随便捡一堆代码然后在外面包一层,最后就是企业客户陪着开发者一起赌命。 DeepSeek Harness 目前仍处于 Developer Preview。今天能够确认的,只是 DeepSeek 打开了插件接口和社区入口。它能不能长成一条真正的专业供应链,还要看后续有没有足够多的开发者、企业客户和解决方案厂商愿意投入。 接下来的问题,恐怕才是本文最核心的部分:DeepSeek 免费把这个入口打开,到底图个啥啊? 最容易想到的答案,是数据。 全世界的开发者都在 DeepSeek Harness 上运行 Agent,DeepSeek 顺手拿走任务轨迹,再用这些数据训练下一代模型。这套说法听起来很符合“数据飞轮”的标准剧本,不好意思,这事儿在技术上根本不 make sense。 [...] DeepSeek Harness 采用宽松的 MIT 开源协议,会话可以直接保存在本地的 JSONL 文件或者 SQLite 数据库中。它虽然提供了基于 OpenTelemetry 的遥测能力,默认状态却是关闭的;即使主动开启,数据发往哪里,也由部署方自己决定。 这意味着,用户通过 Claude、OpenAI 等模型产生的任务轨迹,不会自动流进 DeepSeek。即使调用 DeepSeek 官方 API,它能够看到的也只限于送入该接口的上下文和相关元数据。没有发送给模型的本地日志,以及由其他模型产生的轨迹,并不会自动进入 DeepSeek 服务器。 所以,把 DeepSeek Harness 描述成 DeepS

模型之外,皆属Harness!DeepSeek终于出手:招人、组队、从零造一个中国版Claude Code - InfoQinfoq.cn · supporting

2025 年 2 月,Sonnet 3.7 发布,同时 Claude Code 以研究预览版发布。Anthropic 在公告中明确写道:“我们推出 Claude Code 的目标,是更好地理解开发者如何使用 Claude 进行编码,从而为未来的模型改进提供依据。”也就是说,Claude Code 从一开始就不只是一个开发者工具,更是一个实验性入口——用来观察开发者如何使用 Claude 编码,并把这些观察反哺给模型训练。它承担的任务,远不止产品本身,而是“让模型暴露真实问题”。 同年 5 月,Opus 4 和 Sonnet 4 发布,模型在管理上下文、推进任务方面变得更好。Claude Code 正式 GA,SDK 开放(也就是驱动 Claude Code 的那套 Harness 被公开)。到了 Sonnet 4.5,模型开始具备上下文感知能力,但还不够稳定,于是 Harness 加入了 checkpoints(回退机制)来补这个缺口,运行时长被推到约 30 小时。 这时,Claude Code SDK 改名为 Agent SDK,因为 Anthropic 意识到它的用途比编码广泛得多:这些长时间运行的 harness 可以应用到其他领域了。 Haiku 4.5 和 Opus 4.5 补齐后,用 Opus 做规划、Sonnet 做执行的分工成为可能——这又是 Harness 在模型分化出不同特长后重新编排的结果。同时发布的 skills 采用渐进式披露,本质上也是为了补“上下文窗口”不够用的缺。 [...] 截图来源: 而且 Claude Code 改变的不只是效率,而是任务边界。Anthropic 内部调查显示,约 27% 的任务是开发者没有这个工具时原本不会尝试的。它把“太麻烦、不值得、不敢碰”的工作变成可尝试的任务,让 AI 编程的价值从“省时间”转向“扩大人能做什么”。 更关键的是,Anthropic 把这套 Harness 放出去,每一次真实使用都在收集问题、失败轨迹和用户修正,反哺模型训练,形成了飞轮效应。模型越强,Harness 越顺手;Harness 越顺手,使用越多,模型进步越快。 ## 只做模型,远远不够:模型和 Harness 一起进化 DeepSeek 现在最需要补的,正是这一点。它已经

不只是变现工具,也可能成为数据入口:用户完成 ...x.com · supporting

Deepseek Harness 如果是SDK 为主也能达到数据入口的效果吗? > 像ZCode 这样的Coding 产品,不只是变现工具,也可能成为数据入口:用户完成真实的