模型半年迭代一代,今天精心设计的 Harness,明天可能就成了上一代模型的“拐杖”。
这些问题确实存在。
但我反而觉得,这恰恰是 DSH 最值得研究的地方。
因为仔细看它的 System Prompt,会发现它已经不只是在教模型“怎么写代码”,而是在规定一个 Agent 到底应该怎么工作x甚至还有 Ralph Loop:
每轮创建一个“失忆”的新 Agent,Context 可以丢,但 Workspace 和状态留下来,下一轮继续干。
这已经有点像 Agent 的“进程模型”了。
模型负责推理,Harness 负责:状态、权限、记忆、调度、并行、恢复和收敛。
所以我反而不太关心 DSH 现在能不能打赢 Claude Code / Codex。
真正值得关注的问题是:
当 Agent 从回答一次问题,变成连续工作几个小时、调用几十个工具、启动多个 Agent、中间还能失败和恢复以后,到底谁来管理它?
Prompt 管不了。
模型自己也不应该全管。
我们最终可能真的需要一层 Agent Runtime。
过去卷 Prompt Engineering。
后来卷 Context Engineering。
下一阶段,可能开始卷 Runtime Engineering。
以后评价 Agent,也不能只看裸模了:
Model × Harness,才可能是完整的 Agent 能力。
DeepSeek Harness 可能确实有点“技术理想主义”。
但它也可能只是,走得太早了。


















