榜单头部仍是只答题、不生成文字的决策模型,只是今天多了两条拥有它的路线。NandhaKishorM/laya 一次 33 毫秒的前向传播就把任意文本变成分类选项、分数或是否标记,没有需要解读的生成内容。jaredpalmer/kev 给出开源路线:基于 Qwen3.5 的 0.8B、4B、9B 三种规格可自行训练,一次请求同答选择、是否和打分题,每题都带概率。mizorewww/laya-mlx 则完全不谈训练,把引擎移植到苹果芯片的 MLX 运行时,权重下载后全部本地推理,短问题约 13 毫秒给出判断。想自己调教从 kev 入手,只想要最快的本地答案就先试 laya-mlx。
榜单中段是一场关于智能体运行时要保证什么的讨论。unreallabsai/unreal-agent 押注耐久性:每个输入带调用方给的唯一 ID,会话内去重;会话是只追加、可整体分叉的持久历史;工具调用转成可序列化操作异步执行,重试天然安全。google/ax 押注可运维:一份 YAML 同时声明任务、仓库、MCP 服务器和网络白名单,代理进沙箱运行,还能 SSH 进去看它干活。deepseek-ai/deepseek-harness 走插件化路线,一切能力皆可替换,并附网页界面,但目前仍是开发预览版。
其余几条:CopilotKit/openmuse 把智能体装进一套代码覆盖 iOS、Android 和网页的自托管应用:常驻浏览器、可选 Linux 终端和文件都内置,进度与审批内联展示,随时可以打开它自己的浏览器会话接手;browser-use/jev-ultrafast 走极简路线,一次模型调用同时决定点什么和填什么,README 的演示约七秒查完苏黎世飞伦敦的航班;hypit-ai/hypit 给编程代理一套做视频的语言,把一段参考视频重建为画面、字幕和 B-roll 的完整工作流;jev-chat/jev-chat-jarvis 留在手机上,读懂屏幕上的对话并排好候选回复,但永远不替你点发送。