并行处理应该是 AI Agent 的基础能力,这么聊天太爽了!不用等上一个任务完成,尽管发
Articles tagged with "blog"
定制小龙虾 Pi 近况 #1
这两天基本上把 Pi 的整体框架搭起来了,同时还实现了几个对我来说非常重要的功能: 1. 提供商自动切换 模型有时候因为网络问题或者额度用完直接罢工,现在 Pi 会在重试 3 次后自动切到下一个提供商,并通知我一声。不用手动去改配置,如图。 2. 多主题并行会话...
简单分析下凌晨刚发布的 Opus 4.6 在编码方面的能力:1. Agentic terminal coding 是终端交互能力,提升明显,编写脚本、操作文件更顺畅2. Agentic coding 是核心编程能力,降低了0.1,也就是说代码能力和 Opus 4.5 基本一致3. Scaled tool use 是工具调用能力,降低了2.8,不会更积极的调用 MCP… pic.twitter.com/6XNrewGx88
再简单对比下 Opus 4.6 和 GPT 5.3 Codex
我只根据官方的发布文档进行比较,由于双方的基准测试版本不同,所以没法完全对比,其中只有一个指标是同一个版本的:
1. Terminal-Bench 2.0
- Opus 4.6: 65.4%
- GPT 5.3: 77.3%
GPT 5.3 Codex 在终端命令行的交互上更好,效率更高
其余的编程指标:
2. SWE-Bench(代码库级工程能力)
- Opus 4.6: 80.8%(Verified 版本,只测 Python)
- GPT 5.3: 56.8%(Pro 版本,4 种语言,防污染更严格)
这俩不是同一个测试集。Verified 是 Anthropic 常用的 Python 专项测试;Pro 是 OpenAI 新推的多语言版本,难度和评估标准都不同。不过可以确认的是,两家在各自的测试上都刷新了 SOTA
3. OSWorld(计算机操作/Agent 能力)
- Opus 4.6: 72.7%(原版 OSWorld)
- GPT 5.3: 64.7%(OSWorld-Verified)
看起来 Opus 高,但 Verified 版本修复了原版很多问题,评测更严格可信。人类基线约 72%,所以 GPT 5.3 的 64.7% 实际上更可信,更接近人类水平的表现
总结
复杂问题 / Debug / 做计划 / 超长上下文 / 重构 / Python ===> Opus 4.6
OpenClaw / 个人助理 / 依赖终端交互 / 多语言编程 ===> GPT 5.3
简单分析下凌晨刚发布的 Opus 4.6 在编码方面的能力:
1. Agentic terminal coding 是终端交互能力,提升明显,编写脚本、操作文件更顺畅
2. Agentic coding 是核心编程能力,降低了0.1,也就是说代码能力和 Opus 4.5 基本一致
3. Scaled tool use 是工具调用能力,降低了2.8,不会更积极的调用 MCP
4. Novel problem-solving 是算法/逻辑能力,由于上下文的巨大提升,可以解决更复杂的 bug
总结
Opus 4.6 = Opus 4.5编码能力 + Sonnet 4.5上下文能力 + GPT 5.2 codex 的Debug能力Plus
分享下近段时间,我新订阅的两个很满意的服务:
第一个:InsForge(@InsForge_dev)
这是专门为 AI Agent 开发的后端 Supabase,通过 MCP 和 SKill 让各种 Agent 直接帮你部署数据库、配置后端,省去了大量的运维工作。同时还集成了模型网关(中转 OpenRouter ),一站式解决 Agent 开发的基础设施问题,非常方便,后台功能如图:
我个人更习惯在终端直接命令 Agent 操作,所以后台界面用得不多,但功能挺全的。特别适合不想在后端架构上花费太多时间的开发者。
目前产品迭代速度很快,之前反馈的几个 bug 隔天就修复了,响应很及时。价格如下图
第二个:ZenMux(@ZenMuxAI) (推广链接首充享75折)
LLM API 聚合平台,类似 OpenRouter,但它有个独特优势——订阅制。
提供 20/100/200 刀三档套餐,订阅金额一般能兑换 10 倍左右的 API 用量额度。因为我已经订阅了 Kimi 官方套餐,继续用中转站的 CLI 套餐不仅贵,额度还经常用不完。ZenMux 的 20 刀订阅就很合适:既能灵活中轻度使用各家主流模型,也能用 NanoBananaPro 这类特色模型。
用了半个月,稳定性比我之前用的中转站还要好。
价格如下图,具体的订阅套餐计费方法可以查看官网
原来做文档的 Craft 团队出的 Craft Agent 也太牛逼了!界面非常漂亮,整个交互细节也做得非常到位,完爆昨天的 Codex App他们这套 Agent 的状态流转系统非常巧妙。系统会下意识地引导你去开启多个 Agent,然后你可以通过左边的状态和标签筛选,清晰地看到每一个任务的进展和大概状态。左边多… pic.twitter.com/baBaLcL8kG
2026年才开年一个月,我就已经"渣"了4个Agent工具:Conductor、Auto-Claude、SuperCode,现在正跟 Craft Agent 热恋中。
果然程序员都是海王,喜新厌旧是职业病,永远只爱"年轻"的(指刚发布的新工具)😆
挑战用AI做50个应用#1 短链神器LKS
上次立了"一年做50个小应用"的 flag,结果在构思第一个该做什么时,手滑又收藏了 7 个 AI 工具——别问,问就是"工欲善其事"的标准借口。。。 不过好歹是憋出了第一个:LKS,一个短链接生成器。 动机很简单:给别人发链接时,甩个自己域名的短链,看起来就专业很多😆。当然更重要的是先跑通整个 Vibe Coding 流程,所以功能怎么简单怎么来。 先说说功能:粘贴长链接 →...
被说Kimi水军后,我重新进行了测试并开源
上次夸 Kimi 2.5 超过 opus-4.5 和 gpt-5.2 的文章一发(推特和小红书),我评论区直接炸了。 "推广软文"、"Kimi给你多少钱"、"国产模型怎么可能比 Opus 强"……一排评论看下来,给我整不会了,说实话,被这么质疑挺憋屈的,毕竟 Kimi 也没给我钱呐,我莫名其妙的就成了水军了?...
发现自己有个毛病:看到新的AI工具就手痒想试,先写个笔记或者博客存起来,然后...就没有然后了。
昨天整理收藏夹,发现里面有200多个链接,全是各种AI工具,语音转文字的、自动做PPT的、一键生成代码的...我几乎都试过了,有的还付了月费。
但奇怪的是,工具越用越多,正事却没干几件。每次遇到具体问题,第一反应不是动手解决,而是"有没有 AI 工具能帮我自动做这个?"
然后就开始搜索、对比、看测评、试用...两个小时过去了,问题还在那儿。
昨天突然意识到,我可能陷入了某种假忙碌——忙着优化工具,却忘了优化产出。
所以2026年的计划很简单:做50个小应用,全部尽可能自己用 AI 造轮子,不用很完美,甚至无需很有用,做出来就行,主要是想看看,AI 到底能帮我省多少事,以及在它帮不了我的地方,我有多菜。
不知道自己能不能坚持下来,可能会做到第10个就放弃,也可能第3个就做不下去了。先开始吧,反正最差也就是回到现在的状态——继续刷手机看别人做东西😂
ClawdBot到底能干嘛?
到处都在说未来以来,AI 个人助理,啥事都能干,全能 AI 各种安装教程,配置搞到头秃,各种吹,各种能,就差上天入地了 除了能玩 moltbook ,就是没有看到实际能提升我生活质量的,提高效率的,面向大众的应用场景,感觉就是个全能的废物。。。 所以,有没有人分享下面向大众的使用场景呢,让我开开眼
如果你和我一样,受不了 Conductor 各种小 bug 和卡顿,Auto-Claude 用着也不太顺手,只想要一个简单的多终端搭配 git worktree 管理,那可以试试这个原生的 SuperCode,18.2MB 的安装包,非常轻量,最重要的是,它够用,没有那些花里胡哨的功能和界面,强烈推荐
https://supacode.sh/
这才叫vibe coding!我让AI自己把后端部署了
1月初我才发篇文说《Vibe Coding,得小白者得天下》,结果才过20多天...被打脸了🫠 当时觉得搞后端还是得用 Lovable 这种平台,直到最近才发现可以通过 MCP 直接在本地一句话部署服务?? 玩了几天,对比了好几家后端平台,说点个人感受: - Supabase:确实是老大哥了,生态成熟,但 AI 时代总感觉差点意思。MCP...
You share, we care.Kimi Code is now powered by our best open coding model, Kimi K2.5🔹 Permanent Update: Token-Based Billing We’re saying goodbye to request limits. Starting today, we are permanently switching to a Token-Based Billing system. All usag
Kimi 很听劝呀,计费方式从请求次数改为 token计数了,应该会更耐用些,之前的用量也清零了,可以重新用起来了🤓🤓
用 Kimi 2.5 写了一天多代码,爽。
我前端 Vite + React,后端 Ruby 和 Python 混着搞,还有一个从零起步的小项目,不同类型的项目跑下来,体验都很顺。
但 Kimi CLI 真的很一般,反而在 Claude Code 里跑 Kimi 2.5 要好用得多,甚至比 Opus 还强。感觉 Kimi 对 Claude Code 这套工具链的理解是真的深,工具调用时机和瓶颈卡点它都门清,反而 Opus 在这点上差点意思。Kimi CLI 唯一的好处,大概只有信息展示比较整洁这条了。
不过有个副作用:Kimi 这边 subagent 调用得比 Opus 勤,Claude Code 那祖传的内存泄漏问题就更崩了,跑完一个大任务,经常挂着五六个 subagent 死活不退,进程关了都没用,烦。