← All Tags

Articles tagged with "blog"

427 articles found · RSS · Newsletter

并行处理应该是 AI Agent 的基础能力,这么聊天太爽了!不用等上一个任务完成,尽管发

定制小龙虾 Pi 近况 #1

这两天基本上把 Pi 的整体框架搭起来了,同时还实现了几个对我来说非常重要的功能: 1. 提供商自动切换 模型有时候因为网络问题或者额度用完直接罢工,现在 Pi 会在重试 3 次后自动切到下一个提供商,并通知我一声。不用手动去改配置,如图。 2. 多主题并行会话...

同志们,别再折腾 OpenClaw 全家桶了,直接用它的核心 Pi,从零捏一只专属小龙虾🦞

开局稍微费点功夫,模型配置和 API 密钥那部分得手动填,别的都还好。一旦跑起来,后续所有功能开发全在聊天框里闭环完成。让 AI 自己写扩展自己的功能,这种自举的感觉确实有点不真实。

关键是轻量,要啥装啥,绝不给你硬塞臃肿模块。相比 OpenClaw 那坨黑盒,这种从 0 到 1 的全盘掌控感爽多了。

现在就一个感受:工具链还是要捏在自己手里才踏实。😎

有想折腾的同志不?人多我后续出个踩坑实录,帮你们省点摸黑时间。

试了一天 GPT-5.3 Codex 和 Opus-4.6,结论:GPT-5.3 这啥玩意儿,还不如 5.2 靠谱。 Opus-4.6倒真不错,速度和 debug 能力明显提升。 日常 Kimi + Opus 够用了

简单分析下凌晨刚发布的 Opus 4.6 在编码方面的能力:1. Agentic terminal coding 是终端交互能力,提升明显,编写脚本、操作文件更顺畅2. Agentic coding 是核心编程能力,降低了0.1,也就是说代码能力和 Opus 4.5 基本一致3. Scaled tool use 是工具调用能力,降低了2.8,不会更积极的调用 MCP… pic.twitter.com/6XNrewGx88

再简单对比下 Opus 4.6 和 GPT 5.3 Codex
我只根据官方的发布文档进行比较,由于双方的基准测试版本不同,所以没法完全对比,其中只有一个指标是同一个版本的:

1. Terminal-Bench 2.0

  • Opus 4.6: 65.4%
  • GPT 5.3: 77.3%

GPT 5.3 Codex 在终端命令行的交互上更好,效率更高

其余的编程指标:

 

2. SWE-Bench(代码库级工程能力)

  • Opus 4.6: 80.8%(Verified 版本,只测 Python)
  • GPT 5.3: 56.8%(Pro 版本,4 种语言,防污染更严格)

这俩不是同一个测试集。Verified 是 Anthropic 常用的 Python 专项测试;Pro 是 OpenAI 新推的多语言版本,难度和评估标准都不同。不过可以确认的是,两家在各自的测试上都刷新了 SOTA

 

3. OSWorld(计算机操作/Agent 能力)

  • Opus 4.6: 72.7%(原版 OSWorld)
  • GPT 5.3: 64.7%(OSWorld-Verified)

看起来 Opus 高,但 Verified 版本修复了原版很多问题,评测更严格可信。人类基线约 72%,所以 GPT 5.3 的 64.7% 实际上更可信,更接近人类水平的表现

 

总结

复杂问题 / Debug / 做计划 / 超长上下文 / 重构 / Python ===> Opus 4.6

OpenClaw / 个人助理 / 依赖终端交互 / 多语言编程 ===> GPT 5.3

简单分析下凌晨刚发布的 Opus 4.6 在编码方面的能力:
1. Agentic terminal coding 是终端交互能力,提升明显,编写脚本、操作文件更顺畅

2. Agentic coding 是核心编程能力,降低了0.1,也就是说代码能力和 Opus 4.5 基本一致

3. Scaled tool use 是工具调用能力,降低了2.8,不会更积极的调用 MCP

4. Novel problem-solving 是算法/逻辑能力,由于上下文的巨大提升,可以解决更复杂的 bug

总结

Opus 4.6 = Opus 4.5编码能力 + Sonnet 4.5上下文能力 + GPT 5.2 codex 的Debug能力Plus

分享下近段时间,我新订阅的两个很满意的服务:

第一个:InsForge(@InsForge_dev)

这是专门为 AI Agent 开发的后端 Supabase,通过 MCP 和 SKill 让各种 Agent 直接帮你部署数据库、配置后端,省去了大量的运维工作。同时还集成了模型网关(中转 OpenRouter ),一站式解决 Agent 开发的基础设施问题,非常方便,后台功能如图:

我个人更习惯在终端直接命令 Agent 操作,所以后台界面用得不多,但功能挺全的。特别适合不想在后端架构上花费太多时间的开发者。

目前产品迭代速度很快,之前反馈的几个 bug 隔天就修复了,响应很及时。价格如下图

第二个:ZenMux(@ZenMuxAI) (推广链接首充享75折)

LLM API 聚合平台,类似 OpenRouter,但它有个独特优势——订阅制。

提供 20/100/200 刀三档套餐,订阅金额一般能兑换 10 倍左右的 API 用量额度。因为我已经订阅了 Kimi 官方套餐,继续用中转站的 CLI 套餐不仅贵,额度还经常用不完。ZenMux 的 20 刀订阅就很合适:既能灵活中轻度使用各家主流模型,也能用 NanoBananaPro 这类特色模型。

用了半个月,稳定性比我之前用的中转站还要好。

价格如下图,具体的订阅套餐计费方法可以查看官网

https://insforge.dev/
https://zenmux.ai/invite/6EP3MY

原来做文档的 Craft 团队出的 Craft Agent 也太牛逼了!界面非常漂亮,整个交互细节也做得非常到位,完爆昨天的 Codex App他们这套 Agent 的状态流转系统非常巧妙。系统会下意识地引导你去开启多个 Agent,然后你可以通过左边的状态和标签筛选,清晰地看到每一个任务的进展和大概状态。左边多… pic.twitter.com/baBaLcL8kG

2026年才开年一个月,我就已经"渣"了4个Agent工具:Conductor、Auto-Claude、SuperCode,现在正跟 Craft Agent 热恋中。

果然程序员都是海王,喜新厌旧是职业病,永远只爱"年轻"的(指刚发布的新工具)😆

OpenClaw 用不顺手,有老哥折腾过它的核心 pi-mono 吗?想问问从零自建的话坑多不多,真的能自举吗?

这两天在 AI 的帮助下,总算解决了博客加载缓慢的问题,主要做了以下修改:

  1. 让图片走 CDN 直链,原来是需要通过 Rails 签名来获取图片链接,会阻塞加载
  2. 给每篇文章自动保存一个200字符的摘要,就不用每次都读取全文内容
  3. HTML 缓存到 Cloudflare 上,减少服务器压力

各位可以再试一试哈,欢迎反馈

挑战用AI做50个应用#1 短链神器LKS

上次立了"一年做50个小应用"的 flag,结果在构思第一个该做什么时,手滑又收藏了 7 个 AI 工具——别问,问就是"工欲善其事"的标准借口。。。 不过好歹是憋出了第一个:LKS,一个短链接生成器。 动机很简单:给别人发链接时,甩个自己域名的短链,看起来就专业很多😆。当然更重要的是先跑通整个 Vibe Coding 流程,所以功能怎么简单怎么来。 先说说功能:粘贴长链接 →...

发现一个有意思的测试,问 kimi 图中有几根手指,无论怎么提示,都说是5根😂  @Hx1u0

被说Kimi水军后,我重新进行了测试并开源

上次夸 Kimi 2.5 超过 opus-4.5 和 gpt-5.2 的文章一发(推特和小红书),我评论区直接炸了。 "推广软文"、"Kimi给你多少钱"、"国产模型怎么可能比 Opus 强"……一排评论看下来,给我整不会了,说实话,被这么质疑挺憋屈的,毕竟 Kimi 也没给我钱呐,我莫名其妙的就成了水军了?...

发现自己有个毛病:看到新的AI工具就手痒想试,先写个笔记或者博客存起来,然后...就没有然后了。

昨天整理收藏夹,发现里面有200多个链接,全是各种AI工具,语音转文字的、自动做PPT的、一键生成代码的...我几乎都试过了,有的还付了月费。

但奇怪的是,工具越用越多,正事却没干几件。每次遇到具体问题,第一反应不是动手解决,而是"有没有 AI 工具能帮我自动做这个?"

然后就开始搜索、对比、看测评、试用...两个小时过去了,问题还在那儿。

昨天突然意识到,我可能陷入了某种假忙碌——忙着优化工具,却忘了优化产出。

所以2026年的计划很简单:做50个小应用,全部尽可能自己用 AI 造轮子,不用很完美,甚至无需很有用,做出来就行,主要是想看看,AI 到底能帮我省多少事,以及在它帮不了我的地方,我有多菜。

不知道自己能不能坚持下来,可能会做到第10个就放弃,也可能第3个就做不下去了。先开始吧,反正最差也就是回到现在的状态——继续刷手机看别人做东西😂

ClawdBot到底能干嘛?

到处都在说未来以来,AI 个人助理,啥事都能干,全能 AI 各种安装教程,配置搞到头秃,各种吹,各种能,就差上天入地了 除了能玩 moltbook ,就是没有看到实际能提升我生活质量的,提高效率的,面向大众的应用场景,感觉就是个全能的废物。。。 所以,有没有人分享下面向大众的使用场景呢,让我开开眼

如果你和我一样,受不了 Conductor 各种小 bug 和卡顿,Auto-Claude 用着也不太顺手,只想要一个简单的多终端搭配 git worktree 管理,那可以试试这个原生的 SuperCode,18.2MB 的安装包,非常轻量,最重要的是,它够用,没有那些花里胡哨的功能和界面,强烈推荐
https://supacode.sh/

这才叫vibe coding!我让AI自己把后端部署了

1月初我才发篇文说《Vibe Coding,得小白者得天下》,结果才过20多天...被打脸了🫠 当时觉得搞后端还是得用 Lovable 这种平台,直到最近才发现可以通过 MCP 直接在本地一句话部署服务?? 玩了几天,对比了好几家后端平台,说点个人感受: - Supabase:确实是老大哥了,生态成熟,但 AI 时代总感觉差点意思。MCP...

You share, we care.Kimi Code is now powered by our best open coding model, Kimi K2.5🔹 Permanent Update: Token-Based Billing We’re saying goodbye to request limits. Starting today, we are permanently switching to a Token-Based Billing system. All usag

Kimi 很听劝呀,计费方式从请求次数改为 token计数了,应该会更耐用些,之前的用量也清零了,可以重新用起来了🤓🤓

用 Kimi 2.5 写了一天多代码,爽。

我前端 Vite + React,后端 Ruby 和 Python 混着搞,还有一个从零起步的小项目,不同类型的项目跑下来,体验都很顺。

但 Kimi CLI 真的很一般,反而在 Claude Code 里跑 Kimi 2.5 要好用得多,甚至比 Opus 还强。感觉 Kimi 对 Claude Code 这套工具链的理解是真的深,工具调用时机和瓶颈卡点它都门清,反而 Opus 在这点上差点意思。Kimi CLI 唯一的好处,大概只有信息展示比较整洁这条了。

不过有个副作用:Kimi 这边 subagent 调用得比 Opus 勤,Claude Code 那祖传的内存泄漏问题就更崩了,跑完一个大任务,经常挂着五六个 subagent 死活不退,进程关了都没用,烦。

用 kimi 写完代码后,给 gpt-5.2 review 了快一个小时了,有点担心派蒙能不能吃得消,感觉她在骂人