铭鸿体育资讯网

追风说说科技的文章

今天使用我司内部的 OpenResty Coding Evals 评测集检查全新发布的 GPT-6 Astra 模型,确实在复杂问题的从零编码任务上,已经打败了 Claude Fable 5.1 了,但和 Claude Opus 5 还有一点点差距…… [笑cry]

GPT-6 Astra 的平均总用时也明显比 Claude 模型更少,响应速度更快。

排行榜上也更新了最新的 ​

今天使用我司内部的 OpenResty Coding Evals 评测集检查全新发布的 GPT-6 Astra 模型,确实在复杂问题的从零编码任务上,已经打败了 Claude Fable 5.1 了,但和 Claude Opus 5 还有一点点差距…… [笑cry] GPT-6 Astra 的平均总用时也明显比 Claude 模型更少,响应速度更快。 排行榜上也更新了最新的 ​

今天使用我司内部的 OpenResty Coding Evals 评测集检查全新发布的 GPT-6 Astra 模型,确实在复杂问题的从零编码任务上,已经打败了 Claude Fable 5.1 了,但和 Claude Opus 5 还有一点点差距…… [笑cry] GPT-6 Astra 的平均总用时也明显比 Claude 模型更少,响应速度更快。 排行榜上也更新了最新的 ​

哇,Google 云赠送给我公司的 25 万美元的 credit 终于批准通过了!他们的背调花了好久……要确认我公司的投资 VC 和融资细节……说是接下来 24 小时 ~ 48 小时就会到账了。开心!下面要开始猛烧 Gemini 大模型的 token 了 [笑cry] 我终于也有“欢乐豆”了 [嘻嘻] ​​​​

哇,Google 云赠送给我公司的 25 万美元的 credit 终于批准通过了!他们的背调花了好久……要确认我公司的投资 VC 和融资细节……说是接下来 24 小时 ~ 48 小时就会到账了。开心!下面要开始猛烧 Gemini 大模型的 token 了 [笑cry] 我终于也有“欢乐豆”了 [嘻嘻] ​​​​
刚用我司内部私有的 OpenResty Coding Evals 评测集对比了一下全新的 GPT-6 Astra 模型,确实产出质量评分明显优于上一代的 GPT-5.6 Sol。

同时完成任务的平均总延时并没有比之前退步,这很惊喜!不像 Anthropic 和 Google 的新模型总是比前一版本慢不少……果然 OpenAI 不缺卡啊 [哈哈] ​​​​

刚用我司内部私有的 OpenResty Coding Evals 评测集对比了一下全新的 GPT-6 Astra 模型,确实产出质量评分明显优于上一代的 GPT-5.6 Sol。 同时完成任务的平均总延时并没有比之前退步,这很惊喜!不像 Anthropic 和 Google 的新模型总是比前一版本慢不少……果然 OpenAI 不缺卡啊 [哈哈] ​​​​

刚用我司内部私有的 OpenResty Coding Evals 评测集对比了一下全新的 GPT-6 Astra 模型,确实产出质量评分明显优于上一代的 GPT-5.6 Sol。 同时完成任务的平均总延时并没有比之前退步,这很惊喜!不像 Anthropic 和 Google 的新模型总是比前一版本慢不少……果然 OpenAI 不缺卡啊 [哈哈] ​​​​

Uber 最近也宣布大裁员 10%. 虽然很多人说 AI 会创造更多新岗位,但目前看新增的岗位主要还是能源和算力基建相关的。最近这些年被裁掉的人较难转行过去……普通中小企业也不会有这样的需求…… ​​​​

Uber 最近也宣布大裁员 10%. 虽然很多人说 AI 会创造更多新岗位,但目前看新增的岗位主要还是能源和算力基建相关的。最近这些年被裁掉的人较难转行过去……普通中小企业也不会有这样的需求…… ​​​​
知我莫如ChatGPT,没有你我该怎么活 ​

知我莫如ChatGPT,没有你我该怎么活 ​

知我莫如ChatGPT,没有你我该怎么活 ​

哇,GPT-6 Astra 终于来了!我真的已经跟不上这些 AI 新模型的发布节奏了![允悲] ​​​​ OpenAI 官方宣称无论是绝对智能评分,还是性价比,都完胜 Anthropic 刚发布的 Claude Fable 5.1 [笑cry] 继续卷起来啊,哈哈! ​

哇,GPT-6 Astra 终于来了!我真的已经跟不上这些 AI 新模型的发布节奏了![允悲] ​​​​ OpenAI 官方宣称无论是绝对智能评分,还是性价比,都完胜 Anthropic 刚发布的 Claude Fable 5.1 [笑cry] 继续卷起来啊,哈哈! ​
xAI 新发布的 Grok 4.6 模型的智能水平也比 4.5 明显更高了,我司内部的 OpenResty Coding Evals 评测集上可以明显看出进步。但延时一下子变得超级无敌慢了,这还是 Grok 的响应速度么?[允悲] ​​​​

xAI 新发布的 Grok 4.6 模型的智能水平也比 4.5 明显更高了,我司内部的 OpenResty Coding Evals 评测集上可以明显看出进步。但延时一下子变得超级无敌慢了,这还是 Grok 的响应速度么?[允悲] ​​​​

xAI 新发布的 Grok 4.6 模型的智能水平也比 4.5 明显更高了,我司内部的 OpenResty Coding Evals 评测集上可以明显看出进步。但延时一下子变得超级无敌慢了,这还是 Grok 的响应速度么?[允悲] ​​​​
Anthropic 新发布的 Claude Fable 5.1 神话级模型确实比上一个 5.0 版本更聪明了一些,运行我司内部的 OpenResty Coding Evals 评测集,分数又更高了一些。缺点是完成各种任务的平均延时更长了,更慢了……看来要更智能,就得想更久啊 [允悲]

细节图表见下面两张图。 ​

Anthropic 新发布的 Claude Fable 5.1 神话级模型确实比上一个 5.0 版本更聪明了一些,运行我司内部的 OpenResty Coding Evals 评测集,分数又更高了一些。缺点是完成各种任务的平均延时更长了,更慢了……看来要更智能,就得想更久啊 [允悲] 细节图表见下面两张图。 ​

Anthropic 新发布的 Claude Fable 5.1 神话级模型确实比上一个 5.0 版本更聪明了一些,运行我司内部的 OpenResty Coding Evals 评测集,分数又更高了一些。缺点是完成各种任务的平均延时更长了,更慢了……看来要更智能,就得想更久啊 [允悲] 细节图表见下面两张图。 ​
Google 新发布的 Gemini 3.8 Flash 模型相比之前的 3.6 确实有了明显进步,运行我司私有的 OpenResty Coding Evals 评测集的分数有明显提升。但其平均处理延时也有了明显退步,远没有之前那么快了 [笑cry] 细节见下面两张图。

看来 Google 下面主要是卷高性价比的小模型了?哈哈?Gemini 的 Pro 模型 ​

Google 新发布的 Gemini 3.8 Flash 模型相比之前的 3.6 确实有了明显进步,运行我司私有的 OpenResty Coding Evals 评测集的分数有明显提升。但其平均处理延时也有了明显退步,远没有之前那么快了 [笑cry] 细节见下面两张图。 看来 Google 下面主要是卷高性价比的小模型了?哈哈?Gemini 的 Pro 模型 ​

Google 新发布的 Gemini 3.8 Flash 模型相比之前的 3.6 确实有了明显进步,运行我司私有的 OpenResty Coding Evals 评测集的分数有明显提升。但其平均处理延时也有了明显退步,远没有之前那么快了 [笑cry] 细节见下面两张图。 看来 Google 下面主要是卷高性价比的小模型了?哈哈?Gemini 的 Pro 模型 ​

我们用的一家香港的银行的安全校验真夸张。登录时收手机 App 验证码,居然同时绑定了我手机的设备 ID. 前不久我换了 iPhone Air,结果就导致银行网站无法登录了……还得重新走一遍表格申请和电话验证流程……[允悲] ​​​​幸好没逼我再肉身飞一趟香港…… ​

我们用的一家香港的银行的安全校验真夸张。登录时收手机 App 验证码,居然同时绑定了我手机的设备 ID. 前不久我换了 iPhone Air,结果就导致银行网站无法登录了……还得重新走一遍表格申请和电话验证流程……[允悲] ​​​​幸好没逼我再肉身飞一趟香港…… ​

看起来,即使是最新发布的 Claude Fable 5.1 模型,也还是不会正确使用 pgrep 这条命令。多年来 ,Claude 模型一直不懂 pgrep 很容易命中它自己的进程,于是用它来监视目标进程,很容易永远都不会退出。好傻啊……怎么教都不会吸取教训…… ​

看起来,即使是最新发布的 Claude Fable 5.1 模型,也还是不会正确使用 pgrep 这条命令。多年来 ,Claude 模型一直不懂 pgrep 很容易命中它自己的进程,于是用它来监视目标进程,很容易永远都不会退出。好傻啊……怎么教都不会吸取教训…… ​

之前看到网上有哥们说,公司新人前几个月应该当“agent 学徒”,老人像给 agent 派活一样直接给新人派活,而新人被禁止自己开 agent 干活。新人需要先学会自己当好 agent,才有资格自己创建 agent。不然很容易变成外行指挥内行,就没意义了。 ​

之前看到网上有哥们说,公司新人前几个月应该当“agent 学徒”,老人像给 agent 派活一样直接给新人派活,而新人被禁止自己开 agent 干活。新人需要先学会自己当好 agent,才有资格自己创建 agent。不然很容易变成外行指挥内行,就没意义了。 ​
哟,刚刚 claude code 的 token limit 全都提前 reset 了,我还想是不是因为要向 codex 看齐了,然后才发现原来是因为 Claude Fable 5.1 和 Claude Mythos 5.1 发布了![哈哈] ​​​​官方评测数字挺猛的样子。 ​

哟,刚刚 claude code 的 token limit 全都提前 reset 了,我还想是不是因为要向 codex 看齐了,然后才发现原来是因为 Claude Fable 5.1 和 Claude Mythos 5.1 发布了![哈哈] ​​​​官方评测数字挺猛的样子。 ​

哟,刚刚 claude code 的 token limit 全都提前 reset 了,我还想是不是因为要向 codex 看齐了,然后才发现原来是因为 Claude Fable 5.1 和 Claude Mythos 5.1 发布了![哈哈] ​​​​官方评测数字挺猛的样子。 ​

炎亚纶太精了 在人家都喜欢刺猬头非主流的时候你纶哥已经找到高壮男了 ​

炎亚纶太精了 在人家都喜欢刺猬头非主流的时候你纶哥已经找到高壮男了 ​

哟,Claude Fable 5.1 新的神话级模型很快要发布了?!期待啊…… ​​​​

哟,Claude Fable 5.1 新的神话级模型很快要发布了?!期待啊…… ​​​​

#川美小鸡被农民工偷走吃掉#川美学生搞的“快乐小鸡喂养合作社”,是学生自费做的生态小项目,养了十几只鸡和两只狮头鹅,每只都有名字,同学们轮流照料,还做了周边,不少网友还云养这些小动物。 暑假期间,鸡舍里大部分鸡鹅被人偷走,就剩一只五黑鸡侥幸留下来。学生装的红外监控拍到,是校内施工 ​

#川美小鸡被农民工偷走吃掉#川美学生搞的“快乐小鸡喂养合作社”,是学生自费做的生态小项目,养了十几只鸡和两只狮头鹅,每只都有名字,同学们轮流照料,还做了周边,不少网友还云养这些小动物。 暑假期间,鸡舍里大部分鸡鹅被人偷走,就剩一只五黑鸡侥幸留下来。学生装的红外监控拍到,是校内施工 ​

德约科维奇输了,美网一轮游。他确实年龄大了! 再狡猾的老狐狸也挡不住岁月的侵蚀,传奇要谢幕了,他该退役了。 ​

德约科维奇输了,美网一轮游。他确实年龄大了! 再狡猾的老狐狸也挡不住岁月的侵蚀,传奇要谢幕了,他该退役了。 ​

#会员[超话]# 藤讯电视端云视听svip 月10 芒果🥭电视端 天2 周4 月7 优酷👖电视端酷喵svip周4 月7 小米会员🈷️10 TCl电视🈷️8 如果不回 vx找我 about_zty ​

#会员[超话]# 藤讯电视端云视听svip 月10 芒果🥭电视端 天2 周4 月7 优酷👖电视端酷喵svip周4 月7 小米会员🈷️10 TCl电视🈷️8 如果不回 vx找我 about_zty ​

孙宇晨方主张:代理律师张起淮确认,双方已谈婚论嫁并见过父母,款项是以结婚为目的给付的彩礼,由孙宇晨父母账户直接转入景甜父亲账户。 景甜方可能的抗辩:律师预判,景甜方将重点举证该款项为孙宇晨为增进感情、表达爱意的无偿赠与。一旦被认定为赠与,则无需返还。 司法实践倾向:律师指出,3000余 ​

孙宇晨方主张:代理律师张起淮确认,双方已谈婚论嫁并见过父母,款项是以结婚为目的给付的彩礼,由孙宇晨父母账户直接转入景甜父亲账户。 景甜方可能的抗辩:律师预判,景甜方将重点举证该款项为孙宇晨为增进感情、表达爱意的无偿赠与。一旦被认定为赠与,则无需返还。 司法实践倾向:律师指出,3000余 ​

OpenAI 宣布马上要禁止 Cursor 用他们家的模型了 [笑cry] 下面这些 AI 巨头开始要慢慢划分自己的势力范围了……诸侯割据时代要来了。 ​

OpenAI 宣布马上要禁止 Cursor 用他们家的模型了 [笑cry] 下面这些 AI 巨头开始要慢慢划分自己的势力范围了……诸侯割据时代要来了。 ​