Claude Opus 5评测汇总

在 Vals Index 上排行第2,领先排行第三的 Kimi K3 仅 0.12%

在 Artificial Analysis 中,除了low思考程度成绩不理想外,其它思考程度均挤占前4名

有开发者用 Opus 5 和 Kimi K3 分别做了 3D 游戏,结果显示, Opus 5画面更华丽,但游戏功能有问题;K3 画面次之,可玩性更高,非常扎实。且 Kimi K3 仅花费约 9 分钟,约 4.4 美元。Opus 5.0 花费约 17 分钟(仍在迭代中),约 13 美元以上

同时我看到推上吐槽 Opus 5 比 Fable 还要慢。。。。这。。。。

总之,整体看下来,没有什么惊喜,反而觉得 Kimi K3 性价比爆表,再过2天就要开源了,可用性应该能大大提高吧

tweet-2080804982371283207-192296fc.jpg 66.3 KB
tweet-2080804982371283207-3ae1f1e7.jpg 89 KB
tweet-2080804982371283207-81de42de.png 208 KB
tweet-2080804982371283207-19614126.jpg 91.7 KB
Crazy AI
美国完全可以暂停AI大模型的开发3个月,看看中国ai是不是能超过,如果超过了,美国就可以蒸馏中国的ai嘛。这样省钱了😁
大家一起蒸嘛🥺

哈哈,可以出院了🤣🤣

给自己的博客添加了同步推特的功能,每天定时将我发的推文同步到博客上,

既能解决推文备份功能,防止意外封号

又能方便那些只订阅 rss 的人实时获取我的最新状态

还能挽救早已不更新的博客,焕发新的生机

一举三得😆

tweet-2080468701653225773-37aae479.png 59.4 KB

我发现,那些黄推和 bot 都特喜欢在包含"恭喜"的推文下面留言,不信你试一试

讲个搞笑的事,这周接了某个大厂的商单,要我用它家的模型做个东西吹一下,但由于模型太垃圾,我 vibe 了3天,连滚带爬的改,也做不出啥好东西了。

最后,我拿 kimi k3 做了个,伪装成它家模型,昧着良心吹了😆

做为一个曾经创业失败的人,想给那些折腾 OPC 的人一个建议:

各地方政策不一样,开公司前,一定一定一定要去了解下注销公司的流程和途径

研究人员让五个 AI 模型各自运行模拟社会,Claude 最守规矩、Grok 四天犯下 180 宗罪并灭绝🤣

Claude = Civilization

Grok = GTA

https://fortune.com/2026/05/28/ai-model-simulation-claude-chatgpt-grok-gemini/

Cursor
Introducing Cursor Router, our intelligent model router that selects the right model for the task at hand. Router delivers frontier-quality results at 60% lower cost.

终于来了,等一这个功能等好久了

Kimi Developers
Agent workloads bring long contexts, bursty traffic, and frequent tool calls, creating new demands for AI serving. Together with @AMD , we rebuilt the stack for Kimi K2.6 on AMD Instinct™ MI355X, with scheduler-aware multi-tier KV caching. Up to 3.

AMD Yes!

Datacurve
Gemini 3.6 Flash is now on DeepSWE at 49%, roughly on par with Opus 4.8 at medium reasoning.

恭喜 GLM 5.2 正式成为守门员了🥳🥳🥳