Notice
先看证据,再决定买不买

频道每天最多 3 条价格异动与中转状态;具体商品请用机器人设置降价/补货提醒。交流群提问请带预算、模型、工具和使用频率。

View
Community & contactTelegram 群点击加入Telegram 频道每天最多 3 条有效价格情报联系我们tgAIPricedb交流群979789483
Back to news
Products

DeepSeek Harness: Can an SDK Become an AI Data Gateway?

DeepSeek Harness is presented as an agent workspace that can run through web, terminal, headless and SDK interfaces. It may broaden the use of agents in real software projects, but the available evidence does not show that it automatically creates a DeepSeek-controlled data flywheel.

72% VERIFIED

The available material describes DeepSeek Harness as a developer-preview environment designed to let agents work inside codebases, terminals and longer-running tasks. Alongside an interactive interface, it offers terminal, headless, ACP, JSON-RPC and Python SDK entry points, as well as plugins, task orchestration and multi-agent workflows. These interfaces could make the system easier to embed in enterprise processes rather than limiting it to a standalone coding product.

The data-flywheel argument, however, should be treated as a hypothesis rather than an established fact. The cited documentation says sessions can be stored locally in JSONL or SQLite, telemetry is off by default, and any enabled telemetry is routed according to the deployer’s configuration. Local traces generated through other models are not automatically sent to DeepSeek, so Harness usage alone does not demonstrate a continuous source of training data for DeepSeek.

GLM-5.3 is reported to be available through ZCode and other products, while post-training, tool use and longer task environments are described as important routes to capability gains. Still, the evidence does not independently establish the reported model scale, benchmark improvements, data feedback loop or revenue impact. Usage, conversion and margins remain the more meaningful tests of the business thesis.

Source evidence

DeepSeek正式开源Harness:它终于有了自己的Vibe Coding入口_新浪财经_新浪网finance.sina.com.cn · supporting

以官方目前开放的形态来看,DeepSeek Harness 更接近一套运行在用户本地环境里的 Agent 工作台。 它不只给出答案,还可以进入实际工作环境继续行动。比如,用户可以把一个代码项目所在的文件夹交给它,让它先阅读项目结构和文档,再寻找相关代码、修改文件、调用终端运行程序或测试;如果测试报错,它还可以根据错误信息继续定位问题、再次修改,而不是每一步都等用户复制粘贴代码和报错信息。 这些能力主要通过 Web UI 提供,同时还有面向终端用户的TUI、适合脚本和 CI 的 Headless 模式,以及 ACP、JSON-RPC 和 Python SDK 等自动化入口。换句话说,同一套 Harness 既可以做成人直接操作的编程工作台,也可以被接进自动化流程:例如收到一个任务后自动检查代码、执行测试,完成后再返回结果。提前体验资料显示,这些形态共享同一套模型、会话和底层插件,只是通过不同组件组合成不同的产品形态。 它还支持更复杂的长任务和多 Agent 协作。一个主 Agent 可以把工作拆给多个子 Agent,例如让一个负责搜索项目和资料,一个负责修改代码,另一个负责执行测试,再由主 Agent 汇总结果并决定下一步。官方框架同时提供计划、目标、待办事项和后台任务等机制,目的就是让 Agent 不必局限在“一问一答”,而可以持续完成一串彼此关联的操作。 这让 DeepSeek 开始进入 Claude Code、Codex 等产品已经率先展开的竞争。基础模型公司不再满足于提供一个 API,而是进一步争夺模型和真实计算环境之间的执行层。 [...] 这也是为什么,同一个模型放进不同 Harness,实际表现可能出现明显差异。提前体验 DSH 的媒体曾将同一版本 V4 Flash 放入不同 Agent 框架完成相同任务,结果出现了肉眼可见的差异。当然,单次测试无法证明哪种 Harness 普遍更强,但至少说明,工具、提示词、上下文组织和执行策略已经成为 Agent 最终性能的一部分。 过去谈 DeepSeek,竞争焦点几乎始终落在模型本身:参数规模、训练成本、Benchmark 和 API 价格。但到了 V4 Pro 与 DeepSeek Harness,这条边界正在发生变化。 模型仍然决定智能的上限,但当模型开始真正进入代码库、终端和长期任务后,如何把这

deepseek-harness/packages/core/tools/README.zh.md at master · deepseek-ai/deepseek-harness · GitHubgithub.com · supporting

在 `code`(而非 `both`)下,该传输同时也是模型唯一可用的入口:模型直呼其他任何可见工具名,都会在创建执行时、早于 `tools/pre-execute`、审批 `ask` 和 guards 解析为 `UNKNOWN_TOOL`,因此没有任何一方会观察或批准一个注定失败的调用。拒绝信息会给出正确路径(`only \`run\_code` is callable directly — call `` from inside a `run\_code` program instead`),因为同一份提示词刚刚声明过那个工具,只说` unknown tool`会被读成部署损坏。SDK 子分发携带外层执行的`parent`token,不受此限制,因此程序保留 SDK 声明的全部绑定。参见执行器塌缩 note、Code Mode 基础、类型化返回约定和代码运行时 seam。可以运行`pnpm run demo:code-mode` 试用。 [...] ### Code Mode 在 `code` 或 `both` 模式下,注册表为当前作用域公开保留的 `run_code` 传输和按所加载运行时语言生成的确定性 SDK——注册表按 `ctx.codeRuntime.language` 选择渲染器(`typescript` → 下方的 TypeScript SDK,`python` → Python SDK)。只有程序的外层日志与返回值会重新进入模型上下文。SDK 为每个可见工具声明精确的参数与规范输出类型(TypeScript 为 `ToolArgsMap`/`ToolOutputMap`,Python 为具名 `TypedDict`),每个绑定都会解析为该工具的规范 JSON 值。每个无损 JSON 绑定调用都会在原生调度约定下重新进入完整工具流水线(并发安全的调用最多可重叠 `maxParallelSubCalls` 个;独占调用单独运行并构成排序屏障),并在日志中与外层调用建立关联。拒绝及其他失败结果会以程序实际可见的 `ToolCallError` 形式拒绝,且只携带 `toolName` 和 `message`;Native 内容和内部错误码留在 Code 约定之外。普通副作用不会回滚,子调用的 `additionalContexts` 会通过父结果延迟

刚刚,GLM-5.3来了,拿下多个开源SOTA,我用它“魔改”DeepSeek Harness-36氪m.36kr.com · supporting

目前,GLM-5.3已上线智谱的AI编程工具Zcode、效率工具AutoClaw,支持通过GLM Coding Plan使用。同时,这一模型还在TraeWork、_WorkBuddy_、_Qoder_、OpenCode等平台开放了抢先体验。 智谱称,GLM-5.3的API将很快上线。同时,在模型开源之前,GLM-5.3还将完成安全评估、安全加固,以限制其在网安领域的潜在攻击能力,保留其防御价值。 ## 01 拿真实数据1:1复刻外滩建筑群,还做了个开放世界驾驶游戏 此次测试,我们用到了智谱最近更新的ZCode,搭配旗舰模型GLM-5.3。我们交给GLM-5.3的第一个任务是一份有难度的产品需求文档:以真实的OpenStreetMap数据为基础,开发一款上海陆家嘴至外滩区域的3D开放世界驾驶游戏。 文档中要求,地图解析、坐标转换和游戏逻辑等关键模块全部让模型“手写”,只允许使用Three.js的底层渲染能力。为了测试模型在长任务中的记忆可靠性,我们还在文档中部埋下了两条“陷阱条款”,包括凌晨两点到四点外滩建筑灯光熄灭一半,以及地图边缘需要设置带有提示的软性阻挡。 Image 5 GLM-5.3拿到需求后先验证了数据的真实形态。它编写脚本从Overpass API拉取了8万多个OSM节点,先做了一轮数据勘查,确认地图数据的完整性后,才开始开发。 整个开发过程持续了多轮,最终交付了约4900行代码,覆盖数据管线、车辆物理、车辆音效、导航、昼夜循环和存档系统,两条埋雷条款在最终验收中全部通过。 开发过程中,可以观察到GLM-5.3排查问题的思路很清晰。测试早期,游戏页面完全卡死,它没有盲目改动代码,而是给本地服务器加了请求探针,通过面包屑日志定位到问题。 Image 6 [...] 后训练这条路线近期的受益者不止智谱一家:_DeepSeek_-V4正式版能力的大幅提升,同样与后训练阶段的投入有关。在预训练的数据与算力红利逐渐见顶之后,后训练正成为头部模型厂商进一步提升性能的关键方向,其潜力很可能还未被充分挖掘。 本文来自微信公众号 “智东西”(ID:zhidxcom),作者:陈骏达,36氪经授权发布。 该文观点仅代表作者本人,36氪平台仅提供信息存储空间服务。 +1 0 好文章,需要你的鼓励 []( 3_收 藏_+10_评 论_ _打开微信

DeepSeek Harness 发布后,Agent 这门生意变了huxiu.com · supporting

如果 DeepSeek Harness 真的能够形成插件生态,Agent 行业的成本结构也会跟着改变。 一套通过金融机构安全审查的沙箱,可以同时进入银行、保险和证券公司的不同 Agent;一个成熟的企业记忆插件,也可以被法律、医疗和财务产品反复调用。过去藏在每个项目里的重复开发,有机会变成可以多次交付的标准产品。 但是请注意:插件生态越开放,随之而来的管理成本也会越高。 插件可能接触企业数据、调用内部系统,甚至直接执行代码。任何一个插件出现漏洞,都可能拖累整套 Agent。版本升级以后还能不能运行,几个插件互相冲突应该找谁负责,也会成为新的研发成本。 一个成熟的插件生态,迟早需要安全审查、兼容性测试、版本管理和长期维护。否则所谓开放,很容易变成从 GitHub 上随便捡一堆代码然后在外面包一层,最后就是企业客户陪着开发者一起赌命。 DeepSeek Harness 目前仍处于 Developer Preview。今天能够确认的,只是 DeepSeek 打开了插件接口和社区入口。它能不能长成一条真正的专业供应链,还要看后续有没有足够多的开发者、企业客户和解决方案厂商愿意投入。 接下来的问题,恐怕才是本文最核心的部分:DeepSeek 免费把这个入口打开,到底图个啥啊? 最容易想到的答案,是数据。 全世界的开发者都在 DeepSeek Harness 上运行 Agent,DeepSeek 顺手拿走任务轨迹,再用这些数据训练下一代模型。这套说法听起来很符合“数据飞轮”的标准剧本,不好意思,这事儿在技术上根本不 make sense。 [...] DeepSeek Harness 采用宽松的 MIT 开源协议,会话可以直接保存在本地的 JSONL 文件或者 SQLite 数据库中。它虽然提供了基于 OpenTelemetry 的遥测能力,默认状态却是关闭的;即使主动开启,数据发往哪里,也由部署方自己决定。 这意味着,用户通过 Claude、OpenAI 等模型产生的任务轨迹,不会自动流进 DeepSeek。即使调用 DeepSeek 官方 API,它能够看到的也只限于送入该接口的上下文和相关元数据。没有发送给模型的本地日志,以及由其他模型产生的轨迹,并不会自动进入 DeepSeek 服务器。 所以,把 DeepSeek Harness 描述成 DeepS

模型之外,皆属Harness!DeepSeek终于出手:招人、组队、从零造一个中国版Claude Code - InfoQinfoq.cn · supporting

2025 年 2 月,Sonnet 3.7 发布,同时 Claude Code 以研究预览版发布。Anthropic 在公告中明确写道:“我们推出 Claude Code 的目标,是更好地理解开发者如何使用 Claude 进行编码,从而为未来的模型改进提供依据。”也就是说,Claude Code 从一开始就不只是一个开发者工具,更是一个实验性入口——用来观察开发者如何使用 Claude 编码,并把这些观察反哺给模型训练。它承担的任务,远不止产品本身,而是“让模型暴露真实问题”。 同年 5 月,Opus 4 和 Sonnet 4 发布,模型在管理上下文、推进任务方面变得更好。Claude Code 正式 GA,SDK 开放(也就是驱动 Claude Code 的那套 Harness 被公开)。到了 Sonnet 4.5,模型开始具备上下文感知能力,但还不够稳定,于是 Harness 加入了 checkpoints(回退机制)来补这个缺口,运行时长被推到约 30 小时。 这时,Claude Code SDK 改名为 Agent SDK,因为 Anthropic 意识到它的用途比编码广泛得多:这些长时间运行的 harness 可以应用到其他领域了。 Haiku 4.5 和 Opus 4.5 补齐后,用 Opus 做规划、Sonnet 做执行的分工成为可能——这又是 Harness 在模型分化出不同特长后重新编排的结果。同时发布的 skills 采用渐进式披露,本质上也是为了补“上下文窗口”不够用的缺。 [...] 截图来源: 而且 Claude Code 改变的不只是效率,而是任务边界。Anthropic 内部调查显示,约 27% 的任务是开发者没有这个工具时原本不会尝试的。它把“太麻烦、不值得、不敢碰”的工作变成可尝试的任务,让 AI 编程的价值从“省时间”转向“扩大人能做什么”。 更关键的是,Anthropic 把这套 Harness 放出去,每一次真实使用都在收集问题、失败轨迹和用户修正,反哺模型训练,形成了飞轮效应。模型越强,Harness 越顺手;Harness 越顺手,使用越多,模型进步越快。 ## 只做模型,远远不够:模型和 Harness 一起进化 DeepSeek 现在最需要补的,正是这一点。它已经

不只是变现工具,也可能成为数据入口:用户完成 ...x.com · supporting

Deepseek Harness 如果是SDK 为主也能达到数据入口的效果吗? > 像ZCode 这样的Coding 产品,不只是变现工具,也可能成为数据入口:用户完成真实的