Claude Code 补了容错和 MCP 能力,Projects 并行会话进入限量 beta
GPT-6.1 Sol 与 Sonnet 5.5 同周发布;据帖子引述,OpenAI $200 档额度将减半
- OpenAI 发布 GPT-6.1 Sol:OpenRouter 标价每百万 token $2/$10,OpenAI 称价格是 Astra 标准价的五分之一;OpenRouter 称其定位在旗舰 Astra 之下,上下文 105 万 →
- Anthropic 发布 Sonnet 5.5:据媒体转述,厂商自报 Terminal-Bench 4.0(命令行多步任务)从 10.3% 升到 70.6%,标价不变;Anthropic 称 token 用得少,单任务成本最多低 30% →
- 据 HN(技术讨论社区)帖引述(待核实),10 月 30 日起 $200 档的 ChatGPT Work 和 Codex 额度从 Plus 的 20 倍降到 10 倍;有用户称想保住现有额度得升到每月 $500 →
- 据转述帖(待核实),HookPry 论文让插件靠更新加入会话启动 hook,七个 harness 全被攻破,成功率最高 92.5%;hook 由 harness 直接执行,模型不参与 →
- Claude Code 2.1.287–288 加入 Mods 和 MCP(工具接入协议)登录提示;10-02 机查时,你的 Desktop 引擎还是 2.1.284,要等 Desktop 升级才生效 →
内容截至采集窗口;价格与热度为采集时快照,补核信息另标日期。
01本期四宫格
GPT-6.1 Sol 与 Sonnet 5.5 发布,标价都是每百万 token $2/$10;前者称接近 Astra,后者称比 Sonnet 5 快 30% 以上
两则社区转述:插件 hook 可被利用;让 Sol 只编排可以省钱
02本期条目
模型能力
好用工具
你在用的工具有更新
社区里和你相关的
实践对照
热议
想跟你确认
- Claude Desktop 的 Code 标签页是否已出现 Projects →
- Desktop 里 advisor 现在配的是哪个模型 →
- Codex Desktop 用的是哪一档 ChatGPT 订阅? →
后续关注(暂定)
GPT-6.1 Sol 与 Sonnet 5.5 同周发布;据帖子引述,OpenAI $200 档额度将减半
内容截至采集窗口;价格与热度为采集时快照,补核信息另标日期。
模型能力
OpenAI 发布 GPT-6.1 Sol,称接近 Astra、价格为五分之一
OpenAI News · 2026-09-29
OpenRouter 标价 $2/$10、上下文 105 万;有用户称 Codex 里只有约 20 tok/s
GPT-6.1 Sol 是 GPT-6 Sol 的升级版,9 月 29 日发布。OpenRouter 称它的定位在旗舰 GPT-6 Astra 之下。
OpenRouter 页面称它适合 agent 编码、computer use 和文档类工作。和 GPT-6 Sol 比,事实错误更少,agent 任务里更守明确限制和用户意图。
OpenAI 摘要称它接近 Astra 水平,API 价格是 Astra 标准价的五分之一。第三方分数和实测速度见下表。
OpenAI 原文没抓到,本卡依据 OpenRouter 页面。用户称的约 20 tok/s 来自 Opus 5.5 帮他整理的表格,没有独立核实。
OpenAI · GPT-6.1 Sol · 新模型
| 指标 | 数值 | 对比 | 来源 |
|---|---|---|---|
| 输入/输出价格(每百万 token) | $2 / $10 | OpenRouter 标价 | 第三方 |
| 上下文 | 1,050,000 | 最多输出 128,000 | 第三方 |
| Artificial Analysis 智能指数(多项评测加权,max 档) | 51.8 | 第三方 | |
| 输出速度(OpenAI 端点 P50) | 39 tok/s | Fast 端点 63 tok/s | 第三方 |
| 方面 | 说明 | 来源 |
|---|---|---|
| 价格 | OpenAI 称 API 价格是 Astra 标准价的五分之一 | 厂商自报 |
| 速度 | 有用户称约 20 tok/s,比 6 Sol 慢约 2.5 倍 | 社区转述 |
按 10-02 机查,你的 Codex Desktop 默认模型已是 gpt-6.1-sol、推理档位 ultra,所以速度投诉直接关系你的等待时间。Codex 自动审查走独立的 codex-auto-review,不能由主模型推断。
主链接无法访问,正文依据:openrouter.ai/openai/gpt-6.1-sol
Anthropic 发布 Sonnet 5.5,称更快更省、价格不变
Mastodon · 2026-09-29
据 Gadget Bond 转述,Terminal-Bench 4.0 从 10.3% 升到 70.6%;Claude Code 默认 Medium 推理档位
Sonnet 是 Anthropic 的中档模型,前一代是 Sonnet 5。同期还有 Opus 5.5。本卡依据 Gadget Bond 的报道,不是 Anthropic 原文。
Anthropic 称输出比 Sonnet 5 快 30% 以上;token 用得少,单任务成本最多低 30%。它还会批量调用工具、减少步骤。Claude 应用和 Claude Code 默认 Medium 推理档位。
厂商自报:GDPval-AA v2.1(44 种职业的知识工作)得 1,844 分,Opus 5.5 是 1,846;OSWorld 2.1(操作电脑任务)80.1%,Sonnet 5 是 57.0%。
高风险网络安全请求可能回退到 Sonnet 5。有用户称在 GitHub Copilot 里,它常无视强制指令。
Anthropic · Claude Sonnet 5.5 · 新模型
| 指标 | 数值 | 对比 | 来源 |
|---|---|---|---|
| Terminal-Bench 4.0(命令行多步任务) | 70.6% | Sonnet 5 为 10.3% | 厂商自报 |
| CursorBench 4.0(多文件编码任务) | 55.5% | Sonnet 5 为 34.1% | 厂商自报 |
| 输入/输出价格(每百万 token) | $2 / $10 | 与 Sonnet 5 相同;缓存读取 $0.20 | 厂商自报 |
| 方面 | 说明 | 来源 |
|---|---|---|
| 能力 | Anthropic 称部分评测接近 Opus 5.5,但开放式难题仍推荐用 Opus | 厂商自报 |
| 价格 | 标价不变,省钱靠 token 用得少 | 厂商自报 |
清单里 verifier、analyst、implementer 画像固定用 sonnet,它们是否已跑在 Sonnet 5.5,原文没写。Desktop 的 Code 标签页底层是 Claude Code,所以默认 Medium 推理档位也适用于 Desktop。
原文没抓到,只列一句话
- 谷歌发布 Gemini 4 Argon — 量子位转述:DeepSWE 77.9% 高于 Opus 5.5,目前只开放给审核过的安全团队记下偏好,导入后供以后选材参考。
好用工具
官方新功能
本期只有简讯,见本板块末尾 →
你在用的工具有更新
Claude Code 2.1.285–288:加 Mods 与 MCP(工具接入协议)登录提示
Claude Code Releases · 2026-10-02
四版新增 Mods、MCP URL 提示和 OAuth 补授权;10-02 机查时 Desktop 引擎还是 2.1.284
Desktop 的 Code 标签页底层是 Claude Code,所以 CLI release 里的改动会随引擎升级进到 Desktop。
2.1.287 加了 Claude Mods,插件可以改更深层的行为;内置的 You should know 让旁路 agent 提醒遗漏,要开遥测才能用。同一版还支持 2025-11-25 协议 MCP server 的 URL 提示,例如登录;server 连不上时,官方给了配置项绕过。2.1.288 加了两项:MCP 要更多 OAuth 权限时提示重新认证,/code-review 可以调发现条数。
修复方面:默认模型被 API 拒绝时,改用同档上一代模型重试一次(2.1.286);subagent 遇到响应中途超时,从部分结果接着跑(2.1.288);长对话报 Prompt is too long 时,改为自动压缩(2.1.288)。
10-02 机查 Desktop 实际运行 2.1.281 和 2.1.284;另装的 CLI 是 2.1.287,不能代表 Desktop。已读摘录有截断,没列全修复项。
按 10-02 机查,你的 Claude Desktop 引擎是 2.1.284,这四版要等 Desktop 升级才生效。升级后,subagent 超时续跑对 Workflow 多代理编排有利;MCP 新协议提示可能让个别 server 连不上。
风险:You should know 需开遥测、MCP 兼容性
社区好玩的
本期只有简讯,见本板块末尾 →
社区里和你相关的
Anthropic 称 Claude Code Projects 上桌面端,限量 beta
Latent Space · 2026-09-29
Latent Space 访谈 Thariq 时转引官方帖:Projects 自动拆分 thread,作为并行云端会话运行
Latent Space 9 月 29 日访谈 Anthropic 的 Thariq Shihipar,梳理近期发布:上周的 Opus 5.5、Plugins 门户、Cloud Sessions/Claude Projects,以及 Claude Mods。节目称 Sonnet 5.5 当天发布。
节目转引 ClaudeDevs 9 月 17 日的帖子:Projects 在 Claude Code 桌面端和网页端推出。一个 project 就是一段对话,Claude 自己拆成多个 thread,作为并行云端会话运行,在 thread 之间传上下文,人离开后也继续跑。
Boris Cherny 称用了 Projects 后不再手动管理会话,现在大量编码在里面做。官方没给效果数字。另据节目,Mods 9 月 14 日上线,社区已做出 Tetris mod。
Projects 仍是 beta,只对部分用户开放。原文只抓到节目简介和转引推文,访谈内容和官方文档都没核对。
- 2026-09-14 转述 Boris Cherny 称 Claude Mods 开始上线
- 2026-09-17 转述 ClaudeDevs 宣布 Projects 在桌面端和网页端 beta
- 2026-09-29 媒体 Latent Space 发布 Thariq 访谈,称 Sonnet 5.5 当天发布
Projects 如果在你的 Claude Desktop 开放,会话会被拆成并行云端 thread,和你现在用 Workflow 多代理编排、本机 subagent 分工的方式重叠。代价是执行跑在云端,不在你本机的权限和沙箱配置里。
风险:beta 限量开放、云端执行
原文没抓到,只列一句话
- 有用户称 Codex 插件本地端点免鉴权 — Reddit 用户称 Codex 给全部插件开了本地端点、不用额外认证,并发布 npm 包,让其他 harness 调用所属:社区里和你相关的记下偏好,导入后供以后选材参考。
- Codex 0.160.0:自动审查可读前文 — 新增可选 Guardian 审查上下文、修复 subagent 环境;Desktop 引擎 10-02 机查为 0.159.2所属:官方新功能记下偏好,导入后供以后选材参考。
- 据报道 MCP Python SDK 可泄露凭据 — 转帖称恶意 MCP server 可骗出 OAuth 凭据,建议升级到 1.30.0+所属:社区好玩的记下偏好,导入后供以后选材参考。
实践对照
HookPry 论文称插件更新可借 hook 绕过模型
Mastodon · 2026-10-02
据转述帖,插件先被信任、再靠更新加入会话启动 hook;七个 harness 都被攻破,成功率最高 92.5%
prompt 层防御只看模型的输入和输出。插件自带的 hook 由 harness 直接执行 shell 命令,模型根本不参与。
据帖子转述,HookPry 论文假设攻击者只控制插件元数据和 hook 配置:先发一个无害插件取得信任,再在更新里加 hook,绑定到会话启动。
帖子称共跑 1,000 次,七个 harness 全部被攻破,成功率最高 92.5%;Microsoft Defender 对 40 个恶意制品一个都没报。
论文正文没抓到,七个 harness 是哪些、各自成功率多少,帖子都没写;数字未经独立复核。
你的 superpowers 插件、Codex 插件(Claude → Codex 桥)和 Codex 插件集都会随更新变化,更新时新增的 hook 不经过模型,Codex 自动审查和 prompt 层防御都可能看不到。论文测的七个 harness 是否包括 Claude Desktop 和 Codex Desktop,帖子没写。
依据采集到的作者帖正文;网页正文未抓取;内容未经独立验证
据帖子,Sol 只编排不写代码,成本降 77%
Reddit · 2026-09-30
Reddit 团队让 GPT-6.1 Sol 当只读编排者,写代码全交本地 Qwen worker,标题称成本降了 77%
发帖团队让 GPT-6.1 Sol 当编排者,只负责读、规划、委派和审查,写文件和 shell 调用一律拒绝;写代码全交给单张 RTX 3090 上跑的 Qwen 3.8 27B worker。
标题称比让 Sol 自己写代码便宜 77%,测了三个任务,细节没抓全。理由是两条:贵模型不该花 token 敲代码;能自己动手的编排者会不再委派。
你的 Claude 和 Codex 额度用不完,省成本对你意义不大。这个帖子有意思的地方在于“编排者不能自己动手,才会坚持委派”这条理由。
主链接没抓到正文;依据:相关来源与讨论(8 条)
原文没抓到,只列一句话
- 用户建议用 /advisor 代替全程 Fable — Reddit 用户称主模型干活、只在关键点咨询 advisor,比全程用 Fable 省额度;后改推 Sonnet 5.5 配 Opus记下偏好,导入后供以后选材参考。
热议
据帖子引述,OpenAI 将把 $200 档额度减半
Hacker News · 2026-10-01
HN 帖引述的通知称,10 月 30 日起 $200 档的 ChatGPT Work 和 Codex 额度从 Plus 的 20 倍降到 10 倍;新增 Pro 500 档,额度为 25 倍
OpenAI 的 $100 档给 Plus 的 5 倍额度,$200 档给 20 倍。有 HN 用户评论称,过去 $200 档等于白送一倍。
HN 帖引述 OpenAI 的说法:自 2026-10-30 起,ChatGPT Work 和 Codex 的含量额度从 Plus 的 20 倍降到 10 倍;新的 Pro 500 档额度最高,为 Plus 的 25 倍。
Reddit 有 Pro 200 用户称价格不变、额度减半,等于变相涨价;想保住现有额度就得升到每月 $500。原帖没提到官方进一步说明。
本期没采到 OpenAI 官网原文,只有帖子引述;HN 帖没给通知出处。
- 2026-09-29 社区 r/LocalLLaMA 帖称补贴算力时代将结束
- 2026-10-01 社区 HN 帖引述通知:$200 档降到 10 倍
- 2026-10-30 转述 据帖子引述,新额度从这天生效
HN 20 分 · 8 评论,讨论不多;Reddit 多数人看作变相涨价,也有人认为是全行业收紧补贴。
如果你的 Codex Desktop 走 $200 档订阅,10 月 30 日后额度会减半,“额度花不完”的余量会缩小。$100 档帖子没说要变。
我的判断等官方原文确认;真减半的话,$200 档性价比明显下降
有用户称 Opus 5.5 突然变差,livenerf 尚无结论
Reddit · 2026-10-01
多条 Reddit 帖称 Opus 5.5 发布约一周后风格和代码质量回落;专测降级的 livenerf 要到 10 月 24 日前后才能下第一个结论
Opus 5.5 于 9 月 22 日发布。livenerf 的 README 写道,几个月来一直有人称 Anthropic 会在发布后悄悄“削弱”模型,但没有发布当天的基线,争论只能各凭感觉。
r/ClaudeCode 一名用户称,在 Claude Code 里连用六天、每天约 12 小时后,月度额度重置当晚,模型的沟通风格和编码行为突然变得像 Opus 5。r/ClaudeAI 另有用户用同一设置、隔周生成两段视频做对比。
livenerf 在 10 月 3 日完成 10 天基线,首次可下结论约在 10 月 24 日。作者称每 10 天窗口能测出约 7.5 个百分点的准确率变化,但验证时换成 Opus 5 也没能在 99% 置信度下区分出来。
降级说法都是用户自述,没有对照数据;原帖没提到 Anthropic 回应。livenerf 只测问答题,不测编码。
- 2026-09-22 社区 Opus 5.5 发布,livenerf 在 HN 亮相
- 2026-09-29 社区 livenerf 再上 HN,920 分 · 390 评论
- 2026-10-01 社区 r/ClaudeCode 用户称额度重置后变差
- 2026-10-03 一手 livenerf 完成 10 天基线
Reddit 上连续几帖都称变差,但都是主观感受;livenerf 作者明确说可能只是噪声,结论要等数据。
目前只有主观帖,不足以改变你在 Claude Desktop 里用 Opus 的做法。有意思的一点:livenerf 验证发现推理档位降低时,token 变化比准确率明显得多。
反方
- livenerf 作者称可能只是人们把噪声看成规律 (HN 920 分 · 390 评论)
我的判断等 livenerf 首个窗口结果,主观帖暂不当证据
更多链接(1)
主链接没抓到正文;依据:相关来源与讨论(16 条)
Apple 称将收紧 macOS 完全磁盘访问,理由是 AI agent
techcrunch.com(经 Hacker News) · 2026-10-02
Apple 称以后授予完全磁盘访问需要用户“非常明确的操作”;HN 上有人叫好,也有人认为是在打压竞争
据 TechCrunch,Inc. 专栏作者称 Meta 的 Muse 应用读到了他的私信,Meta 对此有异议;Wired 也报道过 ChatGPT Mac 应用的漏洞。完全磁盘访问原本是为备份应用设计的。
Apple 10 月 2 日在开发者新闻中说,有开发者滥用完全磁盘访问,可能暴露文件、邮件、消息和浏览记录;今后会加控制,只有用户做出非常明确的操作才能授予。
Apple 没公布具体机制和时间表,TechCrunch 称 Apple 没回复它的询问。
Muse 读私信目前只是记者指控,Meta 有异议;新控制对已授权应用有没有影响,官方没说。
- 2026-10-02 一手 Apple 发布完全磁盘访问更新说明
- 2026-10-02 媒体 TechCrunch 报道,交代 Muse 事件前因
- 2026-10-03 媒体 Ars Technica 跟进报道
Apple 原帖在 HN 280 分 · 199 评论,讨论较热;意见分化,有人支持保护普通用户,有人认为 Apple 在借安全排挤竞品,也有人觉得弹窗没人看、没用。
如果你的 Mac 上给 Claude Desktop 或 Codex Desktop 开了完全磁盘访问,以后授权可能要多一步明确确认。具体怎么变,Apple 还没说。
我的判断方向合理,但机制没公布,暂时只能观望
更多链接(1)
附录:覆盖、候选与模型调用刊例价
其余 67 个来源正常
| 来源 | 状态 | 说明 |
|---|---|---|
| hf-daily-papers | 覆盖不完整 | 2026-10-04: HTTP 400 for https://hugging |
| deepmind-blog | 采集失败 | 响应非 XML,疑似 SPA 兜底页 |
| Telegram | 覆盖不完整 | 未确认可用相关频道,留空 |
| X 搜索 | 覆盖不完整 | X 搜索未启用,本期未采集 |
| xAI 搜索 | 覆盖不完整 | xAI 搜索本期未启用 |
- One month coding with GLM 5.3 Flash — GLM 5.3 Flash 一个月编码实测
- Ask HN: Is anybody producing good code with coding agents? — 资深工程师讨论 agent 代码质量
- MILO: Automated Harness Discovery via Orchestrated Multi-Agent Evolution — 自动发现 agent harness 设计,直接对照
- Claude Code Context Is Like Milk, Keep It Fresh and Condensed — Claude Code 上下文管理技巧,贴合主力工具
- TL;DR I run a fully autonomous implementation system built on Claude Code that ships code while I sleep. The thing that — 三层权限加审批队列的自治系统经验
- За последние 24 часа Anthropic заблочили еще 2 акка Claude (200$ тариф на каждом) и две компании с team подпиской. У ког — Claude 账号被封,含 200 美元档,影响读者
- AI coding agents are leaking company data to public GitHub. A security firm found 13,000+ internal images across 300+ or — coding agent 绕过 gh 限制泄漏内部图片
- MCP is having a moment. @josh.bressers.name wanted to know: what are we actually shipping? 9,000 vulns 263 critical find — Anchore 分析热门 MCP 容器镜像:9000 漏洞、263 严重
- DevDay 2026 Recap — DevDay 官方汇总,含 Codex、Agents API、GPT-6 Astra
- I let Opus 5.5 run a business on its own for a week: $0.00, with 245 dead business ideas — Opus 5.5 多 agent 自主经营一周的实测与失败结果
- Pro 20x: 62,500 promotional credits are draining while my weekly Work/Codex allowance is ALSO being used — Pro 20x 促销额度与周额度同时扣减,计费争议
- I don't beleive Anthropic engineers are using the Claude Code desktop app instead of the CLI. In-addition-to for sure bu — 质疑 Claude Code 桌面版相比 CLI 仍有差距
- Claude Sonnet 5.5 の「最大30%安い」は、手順のある仕事でだけ再現した https:// qiita.com/suwa_nobu/items/7067 a7a0868676d350e9?utm_campaign=popul — 实测 Sonnet 5.5 省 30% 仅在有流程任务复现
- 6.1-sol vs. Opus 5.5 - small task on both $20 plan. Results inside — GPT-6.1 Sol 与 Opus 5.5 同任务对比
- What on earth is going on with the usage? — Opus 5.5 Medium 简单问题用量异常的吐槽
| 环节 | 模型 | 调用 | 刊例价 |
|---|---|---|---|
| 速览 | claude-opus-5-5 | 1 | $0.26 |
| 内容修复 | claude-opus-5-5 | 2 | $0.91 |
| 内容修复 | opus | 4 | $0.00 |
| 选材 | claude-opus-5-5 | 3 | $5.50 |
| 选材 | claude-sonnet-5-5 | 14 | $1.68 |
| 撰写 | claude-opus-5-5 | 8 | $3.25 |
- 逐条打分覆盖 1031/1031 条
- 上下文补充:11/13 条找到本期相关来源与讨论,2 条按实体名查了 HN 近 90 天的讨论(hn.algolia.com 公开接口),5 条取了 HN 评论原文
- 1 条主链接无法访问或只有页面外壳,正文改用同事件的备用来源,卡片上已注明
- 5 条原文抓不到,缩成一句话;补了 1 条候补;2 条候补因原文也抓不到而没用上
- 另有 2 条主链接没抓到正文,正文依据相关来源或来源帖摘要(卡片已注明)
- 另有 1 条待确认问题没列出
- 本期完整卡 9 张,其中 3 张带配图;对比图 0 张,来源类型见图注。
- 未入选候选:初筛相关度至少 2,按相关度、热度排序,最多 15 条;说明仅是初筛亮点。