铭鸿体育资讯网

今天,OpenAI把GPT-5.6模型家族接进了Kiro,也就是它和AWS一起做的软件开发Agent工具。三个型号Sol、Terra、Luna,覆盖规划、构建、评审、测试这几个环节,开发者可以直接在kiro.dev用。 最值得拆的是那个82%。OpenAI和AWS说,在Terminal-Bench 2.1上,GPT-5.6 Terra用Kiro的方式完成任务,成本大约降 ​

今天,OpenAI把GPT-5.6模型家族接进了Kiro,也就是它和AWS一起做的软件开发Agent工具。三个型号Sol、Terra、Luna,覆盖规划、构建、评审、测试这几个环节,开发者可以直接在kiro.dev用。

最值得拆的是那个82%。OpenAI和AWS说,在Terminal-Bench 2.1上,GPT-5.6 Terra用Kiro的方式完成任务,成本大约降了82%。这个数字很容易被读成模型变便宜了,但来源说得很清楚,降的不是token单价。

Kiro做的事,是先把高层意图转成清晰的需求、技术设计和可执行任务,再把这份结构化的上下文交给模型。模型一开始就知道团队要建什么、系统该怎么运转、最后要交出什么。规格铺好了,模型站在上面往下做,省掉的是接到一句模糊的话就开写的那种盲目。

这么干省的是返工。规格前置以后,模型更快走到能用的方案,中间走偏的步骤少了。每token的有效产出提高,单位美元换到的活儿也多。所以82%这个数,是模型变强、规格驱动和AWS那边环境优化三件事叠出来的结果,靠任何一项单独都撑不起来。

对开发者来说,看点在于降本路径变了。以前压成本主要靠换更便宜的模型、砍上下文、调参数。这次OpenAI把省钱的杠杆放到了开发流程那一层,模型和工具是绑在一起算账的。Kiro本来已经支持多个模型,现在加了GPT-5.6,团队可以按规划、编码、评审不同阶段去配智能、速度和成本,而不是从头到尾只喂一个型号。

要提醒一句,82%是Terminal-Bench 2.1这一个基准上、用Kiro规格驱动方式测出来的,换到别的任务、别的项目未必照这个比例掉。它说明的是这条路走得通,能省多少还得看自家代码库和工程规范能不能撑起这种前置的规格。基准数字和实际账单之间,永远隔着团队自己的工程严谨度。