目前的 benchmark,也就下面2个比较客观,符合体感和预期:
Articles tagged with "twitter"
Yesterday we launched SWE-1.7 built on the open-source Kimi K2.7.
Concerns about Chinese base models are real: K2.7 completed 87% of tasks that other models refuse over human-rights concerns.
We trained SWE-1.7 specifically on trustworthiness, so i
kimi 的含金量持续提升中
We’re excited to introduce Muse Spark 1.1, a significant upgrade from the first Muse Spark model we released earlier this year.
Along with this release, we are launching a public preview of the new Meta Model API where developers can access Muse Spa
完全淹没在 GPT 5.6 的信息流里,没人在乎,不愧是国外的百度🤣
Grok 4.5 is built for real-world engineering. It excels in large codebases and handles long-running tasks that span multiple repositories, hundreds of skills, and a variety of tools.
grok 4.5 早上简单用了下,感觉还不错,特别是速度,体感上和kimi highspeed 差不多
Big update to managing your past sessions in Hermes Agent.
Now you can prune or archive with a huge array of filters to clean up your session DB without losing anything you don't want to lose.
Get rid of things based on timeframes, models used, use
会话清理功能感觉挺鸡肋的,真有人会去清理会话吗,我反正不会。。。
因为都是我的垃圾,万一以后 AI 发展到能从垃圾中找到宝藏呢😂😂😂
我想开发一款能汇总各类AI工具会话的工具,支持搜索功能。因为常忘记之前在codex、claude或其他chat工具上的提问记录,查找起来很麻烦,若有这样的工具会方便搜索和整理。
不知道是否有人有同样需求?
我貌似找到了 Codex 的平替了
上周我发现了一款让惊艳的 Agent IDE:Orca上周我发现了一款让惊艳的 Agent IDE:Orca
用了一周多,我已经离不开了,Codex 桌面端再也没有打开过了,目前已经成为我主要的 Agent IDE。
说说它的优点:
1. 完全开源!
Codex 桌面端只有 codex 核心是开源的,而且 Codex 越来越卡,bug 是越修越多,看在经常重置用量的情况下,就不继续骂了😆
2. 启动速度很快
使用很流畅,虽然也是基于 Electron 的,但优化的很不错,基本都是秒响应
3. 支持几乎所有的 Agent 框架
Claude Code, Codex, OpenCode, Pi,甚至还支持 Hermes Agent,OpenClaw
4. 支持手机端!!!
它的手机端体验甩 Codex 几条街!搭配 Tailscale 后就没有断连过!你敢信?
5. 支持自动化管理
创建自动化这没什么,但它还能管理 Hermes / OpenClaw 已有的自动化任务
而且还能查看每个自动化任务运行详情,这个太方便了!!
6. 支持编排、计算机控制、本地语音、手机模拟、浏览器等等等一堆功能
还没完,各种功能非常全,而且都很好用,特别是计算机控制,可以和Codex媲美了
总之,除了 Codex 的 Record & Replay 没有,其它地方体验都比 Codex 好!
快去下,不好用你找我,我直播吃!!!
http://x.com/i/article/2057822085838471168
这篇文章挺有意思,我之前也在 discord 上将多个 agent 拉到一个群里进行协作,但效果非常差,不是抢话就是复读循环大乱斗,还有对于当前聊天内容的迟钝反应。
这其实是协作平台(discord)的设计问题,它不是面向 agent 的,它是面向人的,人聊天时能"感觉"节奏,知道什么时候该插嘴,但 agent 是"回合制"的,等 agent 处理完,群里可能已经变天了,但它一无所知
作者在 slock/raft 上做了2个改动:
一个是"收件箱"。agent 可以看到群里消息是否有更新,但是否要阅读这些更新由 agent 自己判断
另一个是"暂存草稿"。agent 写好回复后,系统先检查一下:群里有没有新消息?有就先别发,把变化告诉 agent,让它决定重写、原样发、还是闭嘴。
很有创意的两种方法,如果你也在做多 agent 的产品,或者单纯好奇"为什么我的 agent 群总是这么吵",这篇值得看看
最后,我准备重新试一试 Raft
Aloha! 🌺 Meet Ornith-1.0, a family of open-source LLMs specialized for agentic coding.
Ornith-1.0 spans the full parameter sizes including 9B Dense, 31B Dense, 35B MoE, and 397B MoE. It achieves state-of-the-art performance among open-source model
看起来不错呀,基于gemma 4和qwen 3.5训练的,我去部署看看
刚开了一个 Hermes Agent PR:让 dashboard 里的 cron 任务创建/编辑支持更完整的字段,包括 provider/model/base URL、script、no_agent、context_from、toolsets 和 workdir
https://github.com/NousResearch/hermes-agent/pull/53478
Just opened a Hermes Agent PR to make dashboard cron jobs much more capable: provider/model/base URL overrides, scripts, no_agent, context_from, toolsets, and workdir are now editable from the UI.
Kept it on existing scheduler/API surfaces, no new core tool footprint.
@Teknium
The strongest models are gated and access is granted only to a select few.
Hermes Agent now exposes MoA presets as virtual models, giving you capabilities beyond the publicly available frontier: 8% higher than Opus 4.8 and 11% higher than GPT 5.5 on
每次我觉得 Hermes 已经没什么惊喜的时候,
它总是会推出一些让我眼前一亮的功能
比如这次的 MoA 功能,在这个顶级模型被封禁的节骨眼上,推出的恰到好处
和 OpenRouter 的 Fusion 功能差不多,也是“三个臭皮匠顶个诸葛亮”的思路
✨ 为什么需要它?
单个模型再强也有盲区。MoA(Mixture of Agents)让 多个模型先各自分析,再由一个“Aggregator(汇总者)”整合成最终回答
文档里的基准测试显示:MoA 组合得分 0.8202,比最强的单个模型(Claude Opus 4.8 单独 0.7607)还高出 6 个百分点
---
💡 实际工作流程
每次你发消息,Hermes 内部的处理流程:
1. 并行问参考模型(它们无法调用工具,只分析文本)
2. 把参考模型的回答塞给汇总模型作为“内部参考资料”
3. 汇总模型正式回答你,并决定要不要调用工具
4. 下一轮对话继续重复这个流程
---
⚡️ 几个关键细节
不破坏缓存
• 说明: 参考模型的输出只附加在最新消息尾部,前面的长对话缓存完全命中,不额外烧钱
容错性强
• 说明: 某个参考模型挂了不会崩,其他模型的结果照样用
不能套娃
• 说明: 汇总模型不能是另一个 MoA 预设
有开关
• 说明: 预设里设 enabled: false 就关闭参考模型,汇总模型单独干活
---
🛠️ 怎么用?
最快的方法是在 Dashboard 的 Model 中进行设置,其它方法如下:
1. 快速切换(命令行/TUI)
/moa # 使用默认预设
/moa review # 切换到 review 预设
/moa "你的问题..." # 一次性使用,用完自动切回原模型
2. 选模型时选 MoA
- 在 Dashboard、Desktop GUI 或 CLI 的模型选择里,找到 Mixture of Agents 提供商,下面会列出你配好的预设
3. 用命令行创建预设:hermes moa configure my_preset
---
🎯 适合什么场景?
- 复杂代码审查(多个模型看不同角度)
- 需要深度推理的决策分析
- 创意写作或方案设计(多模型 brainstorming)
- 任何你觉得“一个模型可能想不全”的任务
@NousResearch @Teknium
Introducing a limited preview of GPT-5.6 Sol, our next generation frontier model, as well as GPT-5.6 Terra, a balanced model for efficient, everyday work, and GPT-5.6 Luna, a fast and affordable model for high-volume work.
https://openai.com/index/p
gpt 5.6总算是来了,但可惜,估计是喝不到这小中大杯了🤣