跳到正文
Agent / Harness · 第 2 期第 2 期往期目录
目录
Agent / Harness 动态 · 第 2 期

GPT-6.1 Sol 与 Sonnet 5.5 同周发布;据帖子引述,OpenAI $200 档额度将减半

TL;DR
  • OpenAI 发布 GPT-6.1 Sol:OpenRouter 标价每百万 token $2/$10,OpenAI 称价格是 Astra 标准价的五分之一;OpenRouter 称其定位在旗舰 Astra 之下,上下文 105 万 →
  • Anthropic 发布 Sonnet 5.5:据媒体转述,厂商自报 Terminal-Bench 4.0(命令行多步任务)从 10.3% 升到 70.6%,标价不变;Anthropic 称 token 用得少,单任务成本最多低 30% →
  • 据 HN(技术讨论社区)帖引述(待核实),10 月 30 日起 $200 档的 ChatGPT Work 和 Codex 额度从 Plus 的 20 倍降到 10 倍;有用户称想保住现有额度得升到每月 $500 →
  • 据转述帖(待核实),HookPry 论文让插件靠更新加入会话启动 hook,七个 harness 全被攻破,成功率最高 92.5%;hook 由 harness 直接执行,模型不参与 →
  • Claude Code 2.1.287–288 加入 Mods 和 MCP(工具接入协议)登录提示;10-02 机查时,你的 Desktop 引擎还是 2.1.284,要等 Desktop 升级才生效 →
2026-09-28 → 2026-10-05模型调用刊例价(累计,含重试) $11.60

内容截至采集窗口;价格与热度为采集时快照,补核信息另标日期。

01本期四宫格

模型能力 · 本期重点

GPT-6.1 Sol 与 Sonnet 5.5 发布,标价都是每百万 token $2/$10;前者称接近 Astra,后者称比 Sonnet 5 快 30% 以上

  • GPT-6.1 Sol:第三方 Artificial Analysis 智能指数(多项评测加权)max 档得 51.8,HLE 52.9%、AA-LCR 83.0% →
  • 有用户称 Sol 在 Codex 里只有约 20 tok/s;第三方测得 OpenAI 端点 P50 为 39 tok/s →
  • Sonnet 5.5:厂商自报 OSWorld 2.1(操作电脑任务)80.1%,Sonnet 5 是 57.0%;GDPval-AA v2.1 得 1,844,Opus 5.5 为 1,846 →
好用工具

Claude Code 补了容错和 MCP 能力,Projects 并行会话进入限量 beta

  • 2.1.288:subagent 遇到响应中途超时,从部分结果续跑;对话过长时自动压缩,对 Workflow 多代理编排有利 →
  • 据 Latent Space 转引官方帖,Projects 上了桌面端,会自动拆成并行云端 thread,执行在云端而非本机 →
实践对照

两则社区转述:插件 hook 可被利用;让 Sol 只编排可以省钱

  • 据转述帖,HookPry 跑了 1,000 次,Microsoft Defender 对 40 个恶意制品一个都没报;攻击者只控制插件元数据 →
  • Reddit 团队称让 Sol 只读编排、本地 Qwen 3.8 27B 写代码,标题称成本降 77% →
热议 · 本期重点

额度和降级都是社区说法、待核实;Apple 收紧权限,机制和时间表都未公布

  • 帖子称新增 Pro 500 档,额度为 Plus 的 25 倍;有 $200 档用户称这是变相涨价,$100 档帖子没说要变 →
  • 有用户称 Opus 5.5 突然变差;专测降级的 livenerf 约 10 月 24 日才有首个结论 →
  • Apple 称授予完全磁盘访问将需要用户非常明确的操作,理由是 AI agent 风险上升,没给机制和时间表 →

02本期条目

模型能力

谷歌发布 Gemini 4 Argon环境通用信源媒体类型发布量子位转述:DeepSWE 77.9% 高于 Opus 5.5,目前只开放给审核过的安全团队 原文未抓取

好用工具

官方新功能

你在用的工具有更新

社区好玩的

社区里和你相关的

实践对照

用户建议用 /advisor 代替全程 Fable环境Claude Code信源社区类型实践Reddit 用户称主模型干活、只在关键点咨询 advisor,比全程用 Fable 省额度;后改推 Sonnet 5.5 配 Opus 原文未抓取

热议

想跟你确认

  • Claude Desktop 的 Code 标签页是否已出现 Projects →
  • Desktop 里 advisor 现在配的是哪个模型 →
  • Codex Desktop 用的是哪一档 ChatGPT 订阅? →

后续关注(暂定)

  • Anthropic 称 Claude Code Projects 上桌面端,限量 beta;有新证据时回填 →
  • 用户建议用 /advisor 代替全程 Fable;有新证据时回填 →
  • 据帖子引述,OpenAI 将把 $200 档额度减半;有新证据时回填 →
读完整版 →
Agent / Harness 动态 · 完整版

GPT-6.1 Sol 与 Sonnet 5.5 同周发布;据帖子引述,OpenAI $200 档额度将减半

2026-09-28 → 2026-10-05模型调用刊例价(累计,含重试) $11.60

内容截至采集窗口;价格与热度为采集时快照,补核信息另标日期。

模型能力

OpenAI 发布 GPT-6.1 Sol,称接近 Astra、价格为五分之一

用户自述
环境Codex、API(模型接口)信源官方类型发布

OpenAI News · 2026-09-29

OpenRouter 标价 $2/$10、上下文 105 万;有用户称 Codex 里只有约 20 tok/s

背景

GPT-6.1 Sol 是 GPT-6 Sol 的升级版,9 月 29 日发布。OpenRouter 称它的定位在旗舰 GPT-6 Astra 之下。

新在哪

OpenRouter 页面称它适合 agent 编码、computer use 和文档类工作。和 GPT-6 Sol 比,事实错误更少,agent 任务里更守明确限制和用户意图。

效果

OpenAI 摘要称它接近 Astra 水平,API 价格是 Astra 标准价的五分之一。第三方分数和实测速度见下表。

注意

OpenAI 原文没抓到,本卡依据 OpenRouter 页面。用户称的约 20 tok/s 来自 Opus 5.5 帮他整理的表格,没有独立核实。

OpenAI · GPT-6.1 Sol · 新模型

指标数值对比来源
输入/输出价格(每百万 token)$2 / $10OpenRouter 标价第三方
上下文1,050,000最多输出 128,000第三方
Artificial Analysis 智能指数(多项评测加权,max 档)51.8第三方
输出速度(OpenAI 端点 P50)39 tok/sFast 端点 63 tok/s第三方
比上一代好在哪
方面说明来源
价格OpenAI 称 API 价格是 Astra 标准价的五分之一厂商自报
速度有用户称约 20 tok/s,比 6 Sol 慢约 2.5 倍社区转述
社区怎么看

社区主要抱怨两件事:速度慢、命名混乱。原帖没提到官方回应。

放到你的环境里

按 10-02 机查,你的 Codex Desktop 默认模型已是 gpt-6.1-sol、推理档位 ultra,所以速度投诉直接关系你的等待时间。Codex 自动审查走独立的 codex-auto-review,不能由主模型推断。

主链接无法访问,正文依据:openrouter.ai/openai/gpt-6.1-sol

Anthropic 发布 Sonnet 5.5,称更快更省、价格不变

媒体转述Mastodon 0 转发 · 0 赞 · 0 评论
环境Claude Code、API信源媒体类型发布

Mastodon · 2026-09-29

据 Gadget Bond 转述,Terminal-Bench 4.0 从 10.3% 升到 70.6%;Claude Code 默认 Medium 推理档位

图源:Mastodon(原文预览图)
图源:Mastodon(原文预览图)
背景

Sonnet 是 Anthropic 的中档模型,前一代是 Sonnet 5。同期还有 Opus 5.5。本卡依据 Gadget Bond 的报道,不是 Anthropic 原文。

新在哪

Anthropic 称输出比 Sonnet 5 快 30% 以上;token 用得少,单任务成本最多低 30%。它还会批量调用工具、减少步骤。Claude 应用和 Claude Code 默认 Medium 推理档位。

效果

厂商自报:GDPval-AA v2.1(44 种职业的知识工作)得 1,844 分,Opus 5.5 是 1,846;OSWorld 2.1(操作电脑任务)80.1%,Sonnet 5 是 57.0%。

注意

高风险网络安全请求可能回退到 Sonnet 5。有用户称在 GitHub Copilot 里,它常无视强制指令。

Anthropic · Claude Sonnet 5.5 · 新模型

指标数值对比来源
Terminal-Bench 4.0(命令行多步任务)70.6%Sonnet 5 为 10.3%厂商自报
CursorBench 4.0(多文件编码任务)55.5%Sonnet 5 为 34.1%厂商自报
输入/输出价格(每百万 token)$2 / $10与 Sonnet 5 相同;缓存读取 $0.20厂商自报
比上一代好在哪
方面说明来源
能力Anthropic 称部分评测接近 Opus 5.5,但开放式难题仍推荐用 Opus厂商自报
价格标价不变,省钱靠 token 用得少厂商自报
社区怎么看

社区普遍觉得它聪明、快,但有用户报告指令遵循变差。

放到你的环境里

清单里 verifier、analyst、implementer 画像固定用 sonnet,它们是否已跑在 Sonnet 5.5,原文没写。Desktop 的 Code 标签页底层是 Claude Code,所以默认 Medium 推理档位也适用于 Desktop。

原文没抓到,只列一句话

好用工具

官方新功能

本期只有简讯,见本板块末尾 →

你在用的工具有更新

Claude Code 2.1.285–288:加 Mods 与 MCP(工具接入协议)登录提示

环境Claude Code信源官方类型发布

Claude Code Releases · 2026-10-02

四版新增 Mods、MCP URL 提示和 OAuth 补授权;10-02 机查时 Desktop 引擎还是 2.1.284

背景

Desktop 的 Code 标签页底层是 Claude Code,所以 CLI release 里的改动会随引擎升级进到 Desktop。

新在哪

2.1.287 加了 Claude Mods,插件可以改更深层的行为;内置的 You should know 让旁路 agent 提醒遗漏,要开遥测才能用。同一版还支持 2025-11-25 协议 MCP server 的 URL 提示,例如登录;server 连不上时,官方给了配置项绕过。2.1.288 加了两项:MCP 要更多 OAuth 权限时提示重新认证,/code-review 可以调发现条数。

效果

修复方面:默认模型被 API 拒绝时,改用同档上一代模型重试一次(2.1.286);subagent 遇到响应中途超时,从部分结果接着跑(2.1.288);长对话报 Prompt is too long 时,改为自动压缩(2.1.288)。

注意

10-02 机查 Desktop 实际运行 2.1.281 和 2.1.284;另装的 CLI 是 2.1.287,不能代表 Desktop。已读摘录有截断,没列全修复项。

放到你的环境里

按 10-02 机查,你的 Claude Desktop 引擎是 2.1.284,这四版要等 Desktop 升级才生效。升级后,subagent 超时续跑对 Workflow 多代理编排有利;MCP 新协议提示可能让个别 server 连不上。

风险:You should know 需开遥测、MCP 兼容性

社区好玩的

本期只有简讯,见本板块末尾 →

社区里和你相关的

Anthropic 称 Claude Code Projects 上桌面端,限量 beta

转引推文
环境Claude Code信源媒体类型发布

Latent Space · 2026-09-29

Latent Space 访谈 Thariq 时转引官方帖:Projects 自动拆分 thread,作为并行云端会话运行

图源:Latent Space(原文预览图)
图源:Latent Space(原文预览图)
背景

Latent Space 9 月 29 日访谈 Anthropic 的 Thariq Shihipar,梳理近期发布:上周的 Opus 5.5、Plugins 门户、Cloud Sessions/Claude Projects,以及 Claude Mods。节目称 Sonnet 5.5 当天发布。

新在哪

节目转引 ClaudeDevs 9 月 17 日的帖子:Projects 在 Claude Code 桌面端和网页端推出。一个 project 就是一段对话,Claude 自己拆成多个 thread,作为并行云端会话运行,在 thread 之间传上下文,人离开后也继续跑。

效果

Boris Cherny 称用了 Projects 后不再手动管理会话,现在大量编码在里面做。官方没给效果数字。另据节目,Mods 9 月 14 日上线,社区已做出 Tetris mod。

注意

Projects 仍是 beta,只对部分用户开放。原文只抓到节目简介和转引推文,访谈内容和官方文档都没核对。

放到你的环境里

Projects 如果在你的 Claude Desktop 开放,会话会被拆成并行云端 thread,和你现在用 Workflow 多代理编排、本机 subagent 分工的方式重叠。代价是执行跑在云端,不在你本机的权限和沙箱配置里。

风险:beta 限量开放、云端执行

原文没抓到,只列一句话

  • 有用户称 Codex 插件本地端点免鉴权 — Reddit 用户称 Codex 给全部插件开了本地端点、不用额外认证,并发布 npm 包,让其他 harness 调用
    所属:社区里和你相关的环境Codex信源社区类型工具
  • Codex 0.160.0:自动审查可读前文 — 新增可选 Guardian 审查上下文、修复 subagent 环境;Desktop 引擎 10-02 机查为 0.159.2
    所属:官方新功能环境Codex信源官方类型发布
  • 据报道 MCP Python SDK 可泄露凭据 — 转帖称恶意 MCP server 可骗出 OAuth 凭据,建议升级到 1.30.0+
    所属:社区好玩的环境通用信源媒体类型事件

实践对照

HookPry 论文称插件更新可借 hook 绕过模型

待核实网页未抓取Mastodon 1 转发 · 1 赞 · 1 评论
环境Claude Code、Codex、通用信源社区类型评测

Mastodon · 2026-10-02

据转述帖,插件先被信任、再靠更新加入会话启动 hook;七个 harness 都被攻破,成功率最高 92.5%

为什么测

prompt 层防御只看模型的输入和输出。插件自带的 hook 由 harness 直接执行 shell 命令,模型根本不参与。

测了什么

据帖子转述,HookPry 论文假设攻击者只控制插件元数据和 hook 配置:先发一个无害插件取得信任,再在更新里加 hook,绑定到会话启动。

结论

帖子称共跑 1,000 次,七个 harness 全部被攻破,成功率最高 92.5%;Microsoft Defender 对 40 个恶意制品一个都没报。

局限

论文正文没抓到,七个 harness 是哪些、各自成功率多少,帖子都没写;数字未经独立复核。

放到你的环境里

你的 superpowers 插件、Codex 插件(Claude → Codex 桥)和 Codex 插件集都会随更新变化,更新时新增的 hook 不经过模型,Codex 自动审查和 prompt 层防御都可能看不到。论文测的七个 harness 是否包括 Claude Desktop 和 Codex Desktop,帖子没写。

依据采集到的作者帖正文;网页正文未抓取;内容未经独立验证

据帖子,Sol 只编排不写代码,成本降 77%

用户自述原文未抓取
环境Codex、其他 agent信源社区类型实践

Reddit · 2026-09-30

Reddit 团队让 GPT-6.1 Sol 当只读编排者,写代码全交本地 Qwen worker,标题称成本降了 77%

怎么做的

发帖团队让 GPT-6.1 Sol 当编排者,只负责读、规划、委派和审查,写文件和 shell 调用一律拒绝;写代码全交给单张 RTX 3090 上跑的 Qwen 3.8 27B worker。

结果与证据

标题称比让 Sol 自己写代码便宜 77%,测了三个任务,细节没抓全。理由是两条:贵模型不该花 token 敲代码;能自己动手的编排者会不再委派。

看个乐

你的 Claude 和 Codex 额度用不完,省成本对你意义不大。这个帖子有意思的地方在于“编排者不能自己动手,才会坚持委派”这条理由。

主链接没抓到正文;依据:相关来源与讨论(8 条)

原文没抓到,只列一句话

热议

据帖子引述,OpenAI 将把 $200 档额度减半

待核实HN(技术讨论社区)20 分 · 8 评论
环境Codex信源社区类型事件

Hacker News · 2026-10-01

HN 帖引述的通知称,10 月 30 日起 $200 档的 ChatGPT Work 和 Codex 额度从 Plus 的 20 倍降到 10 倍;新增 Pro 500 档,额度为 25 倍

背景

OpenAI 的 $100 档给 Plus 的 5 倍额度,$200 档给 20 倍。有 HN 用户评论称,过去 $200 档等于白送一倍。

发生了什么

HN 帖引述 OpenAI 的说法:自 2026-10-30 起,ChatGPT Work 和 Codex 的含量额度从 Plus 的 20 倍降到 10 倍;新的 Pro 500 档额度最高,为 Plus 的 25 倍。

现在的状况

Reddit 有 Pro 200 用户称价格不变、额度减半,等于变相涨价;想保住现有额度就得升到每月 $500。原帖没提到官方进一步说明。

还没核实的

本期没采到 OpenAI 官网原文,只有帖子引述;HN 帖没给通知出处。

社区怎么看

HN 20 分 · 8 评论,讨论不多;Reddit 多数人看作变相涨价,也有人认为是全行业收紧补贴。

放到你的环境里

如果你的 Codex Desktop 走 $200 档订阅,10 月 30 日后额度会减半,“额度花不完”的余量会缩小。$100 档帖子没说要变。

为什么值得看同价额度减半,是补贴到头还是变相涨价
我的判断

等官方原文确认;真减半的话,$200 档性价比明显下降

有用户称 Opus 5.5 突然变差,livenerf 尚无结论

用户自述待核实原文未抓取
环境Claude Code信源社区类型事件

Reddit · 2026-10-01

多条 Reddit 帖称 Opus 5.5 发布约一周后风格和代码质量回落;专测降级的 livenerf 要到 10 月 24 日前后才能下第一个结论

背景

Opus 5.5 于 9 月 22 日发布。livenerf 的 README 写道,几个月来一直有人称 Anthropic 会在发布后悄悄“削弱”模型,但没有发布当天的基线,争论只能各凭感觉。

发生了什么

r/ClaudeCode 一名用户称,在 Claude Code 里连用六天、每天约 12 小时后,月度额度重置当晚,模型的沟通风格和编码行为突然变得像 Opus 5。r/ClaudeAI 另有用户用同一设置、隔周生成两段视频做对比。

现在的状况

livenerf 在 10 月 3 日完成 10 天基线,首次可下结论约在 10 月 24 日。作者称每 10 天窗口能测出约 7.5 个百分点的准确率变化,但验证时换成 Opus 5 也没能在 99% 置信度下区分出来。

还没核实的

降级说法都是用户自述,没有对照数据;原帖没提到 Anthropic 回应。livenerf 只测问答题,不测编码。

社区怎么看

Reddit 上连续几帖都称变差,但都是主观感受;livenerf 作者明确说可能只是噪声,结论要等数据。

看个乐

目前只有主观帖,不足以改变你在 Claude Desktop 里用 Opus 的做法。有意思的一点:livenerf 验证发现推理档位降低时,token 变化比准确率明显得多。

为什么值得看Opus 5.5 是否在发布后被悄悄削弱
我的判断

等 livenerf 首个窗口结果,主观帖暂不当证据

主链接没抓到正文;依据:相关来源与讨论(16 条)

Apple 称将收紧 macOS 完全磁盘访问,理由是 AI agent

HN 18 分 · 7 评论
环境通用信源官方类型事件

techcrunch.com(经 Hacker News) · 2026-10-02

Apple 称以后授予完全磁盘访问需要用户“非常明确的操作”;HN 上有人叫好,也有人认为是在打压竞争

图源:techcrunch.com(原文预览图)
图源:techcrunch.com(原文预览图)
背景

据 TechCrunch,Inc. 专栏作者称 Meta 的 Muse 应用读到了他的私信,Meta 对此有异议;Wired 也报道过 ChatGPT Mac 应用的漏洞。完全磁盘访问原本是为备份应用设计的。

发生了什么

Apple 10 月 2 日在开发者新闻中说,有开发者滥用完全磁盘访问,可能暴露文件、邮件、消息和浏览记录;今后会加控制,只有用户做出非常明确的操作才能授予。

现在的状况

Apple 没公布具体机制和时间表,TechCrunch 称 Apple 没回复它的询问。

还没核实的

Muse 读私信目前只是记者指控,Meta 有异议;新控制对已授权应用有没有影响,官方没说。

社区怎么看

Apple 原帖在 HN 280 分 · 199 评论,讨论较热;意见分化,有人支持保护普通用户,有人认为 Apple 在借安全排挤竞品,也有人觉得弹窗没人看、没用。

放到你的环境里

如果你的 Mac 上给 Claude Desktop 或 Codex Desktop 开了完全磁盘访问,以后授权可能要多一步明确确认。具体怎么变,Apple 还没说。

为什么值得看收紧授权是保护用户,还是打压竞争
我的判断

方向合理,但机制没公布,暂时只能观望

附录:覆盖、候选与模型调用刊例价
覆盖情况

其余 67 个来源正常

来源状态说明
hf-daily-papers覆盖不完整2026-10-04: HTTP 400 for https://hugging
deepmind-blog采集失败响应非 XML,疑似 SPA 兜底页
Telegram覆盖不完整未确认可用相关频道,留空
X 搜索覆盖不完整X 搜索未启用,本期未采集
xAI 搜索覆盖不完整xAI 搜索本期未启用
未入选候选
  • One month coding with GLM 5.3 Flash — GLM 5.3 Flash 一个月编码实测
  • Ask HN: Is anybody producing good code with coding agents? — 资深工程师讨论 agent 代码质量
  • MILO: Automated Harness Discovery via Orchestrated Multi-Agent Evolution — 自动发现 agent harness 设计,直接对照
  • Claude Code Context Is Like Milk, Keep It Fresh and Condensed — Claude Code 上下文管理技巧,贴合主力工具
  • TL;DR I run a fully autonomous implementation system built on Claude Code that ships code while I sleep. The thing that — 三层权限加审批队列的自治系统经验
  • За последние 24 часа Anthropic заблочили еще 2 акка Claude (200$ тариф на каждом) и две компании с team подпиской. У ког — Claude 账号被封,含 200 美元档,影响读者
  • AI coding agents are leaking company data to public GitHub. A security firm found 13,000+ internal images across 300+ or — coding agent 绕过 gh 限制泄漏内部图片
  • MCP is having a moment. @josh.bressers.name wanted to know: what are we actually shipping? 9,000 vulns 263 critical find — Anchore 分析热门 MCP 容器镜像:9000 漏洞、263 严重
  • DevDay 2026 Recap — DevDay 官方汇总,含 Codex、Agents API、GPT-6 Astra
  • I let Opus 5.5 run a business on its own for a week: $0.00, with 245 dead business ideas — Opus 5.5 多 agent 自主经营一周的实测与失败结果
  • Pro 20x: 62,500 promotional credits are draining while my weekly Work/Codex allowance is ALSO being used — Pro 20x 促销额度与周额度同时扣减,计费争议
  • I don't beleive Anthropic engineers are using the Claude Code desktop app instead of the CLI. In-addition-to for sure bu — 质疑 Claude Code 桌面版相比 CLI 仍有差距
  • Claude Sonnet 5.5 の「最大30%安い」は、手順のある仕事でだけ再現した https:// qiita.com/suwa_nobu/items/7067 a7a0868676d350e9?utm_campaign=popul — 实测 Sonnet 5.5 省 30% 仅在有流程任务复现
  • 6.1-sol vs. Opus 5.5 - small task on both $20 plan. Results inside — GPT-6.1 Sol 与 Opus 5.5 同任务对比
  • What on earth is going on with the usage? — Opus 5.5 Medium 简单问题用量异常的吐槽
模型调用刊例价
环节模型调用刊例价
速览claude-opus-5-51$0.26
内容修复claude-opus-5-52$0.91
内容修复opus4$0.00
选材claude-opus-5-53$5.50
选材claude-sonnet-5-514$1.68
撰写claude-opus-5-58$3.25
方法说明
  • 逐条打分覆盖 1031/1031 条
  • 上下文补充:11/13 条找到本期相关来源与讨论,2 条按实体名查了 HN 近 90 天的讨论(hn.algolia.com 公开接口),5 条取了 HN 评论原文
  • 1 条主链接无法访问或只有页面外壳,正文改用同事件的备用来源,卡片上已注明
  • 5 条原文抓不到,缩成一句话;补了 1 条候补;2 条候补因原文也抓不到而没用上
  • 另有 2 条主链接没抓到正文,正文依据相关来源或来源帖摘要(卡片已注明)
  • 另有 1 条待确认问题没列出
  • 本期完整卡 9 张,其中 3 张带配图;对比图 0 张,来源类型见图注。
  • 未入选候选:初筛相关度至少 2,按相关度、热度排序,最多 15 条;说明仅是初筛亮点。
回顶部