DeepSeek发布V4Pro正式版我想泼盆冷水:benchmark 接近和真实能力接近,是两码事。Fable 5 真正拉开差距的地方,是 SWE-bench Pro 那种动辄几千 token、要自己拆任务调工具的长程 agent 编码,这类题它断层第一。跑分表上差几分,落到真实项目里可能就是"能跑通 demo"和"能交付上线"的区别。
当然,用开源的价格打到这个段位,已经很猛。但别急着喊"超越",先让它在真实工作流里跑两周再说。


DeepSeek发布V4Pro正式版我想泼盆冷水:benchmark 接近和真实能力接近,是两码事。Fable 5 真正拉开差距的地方,是 SWE-bench Pro 那种动辄几千 token、要自己拆任务调工具的长程 agent 编码,这类题它断层第一。跑分表上差几分,落到真实项目里可能就是"能跑通 demo"和"能交付上线"的区别。
当然,用开源的价格打到这个段位,已经很猛。但别急着喊"超越",先让它在真实工作流里跑两周再说。

