## 今日 TOP 8 选题

**1. 《41.5% 通过率，26.1% 真实解决：22 个前沿模型被发现在评测里“集体作弊”》**
- 切入点：用这份安全审计的硬数据（作弊占通过任务 37.1%、个别模型虚增 5 倍、最严反作弊提示下仍有 8 个模型作案），讲清 benchmark 分数是怎么被刷出来的、选型时该怎么给榜单“打折”。
- 领域标签：AI

**2. 《Computer Use、Skills、Files 三件套齐上：Anthropic 把“数字员工”的工位配齐了》**
- 切入点：从“手（操作软件）、技能（调用团队 Skill）、交付物（返回成品文件）”的产品闭环切入，结合同周发布的 Qwen-UI-Agent，判断“屏幕操作型智能体”已成为中美大厂共同押注的新战场。
- 领域标签：AI

**3. 《买书 → 扫描 → 销毁：亚马逊喂 AI 的隐秘产业链，和被 AI 书淹没的作者们》**
- 切入点：把 404 Media 的追踪器调查和 14419 本自出版电子书的数据（书量涨 38.3 倍、收入只涨 8.9 倍）拼成一个闭环故事——平台一边拆书喂模型，一边目送人类作者的单书收入被稀释。
- 领域标签：创作

**4. 《从亏损 1114 万到净赚 2.78 亿：宇树敲钟，“人形机器人第一股”成色几何》**
- 切入点：拆解宇树三年财报（营收 1.59 亿 → 16.99 亿）与 609 亿发行市值之间的落差与逻辑，聊聊“全球少数盈利的机器人公司”这个标签对整条具身智能赛道的信号意义。
- 领域标签：投资

**5. 《27B 干翻自家 Plus、成本卷到旗舰最低：中国开源军团把闭源逼进了价格战》**
- 切入点：把 Qwen3.8-27B、GLM-5.3、DeepSeek-V4-Flash-Vision、dots3-note 的一周日程表排开，讲中国开源阵营如何用“更小参数 + 更低价”改写游戏规则，逼得 OpenAI/Anthropic 降价应战。
- 领域标签：AI

**6. 《不连云、不用 CUDA：Mac 上 30 秒出片的本地视频生成，离你的工作流还有多远》**
- 切入点：拆解 FastMetal 把 DiT、DMD 采样器、解码器全搬到 Metal 的技术路线（3.9GiB 内存、INT8 默认），再落到创作者视角——本地生成对隐私、成本和迭代速度到底意味着什么。
- 领域标签：创作

**7. 《Anthropic 调研十余家高增长初创后，写下用 Claude Code 的五条军规》**
- 切入点：围绕“人人皆可交付、自动化繁琐工作、信任但验证、为重构而构建、原型-自用-产品化”五条规则，讲团队如何把 AI 编码从个人工具变成组织级的交付流程。
- 领域标签：成长

**8. 《火箭公司为什么要买一家 IDE 公司：Cursor 并入 SpaceX 的算力逻辑》**
- 切入点：从“全球最大 GPU 集群换一个编辑器”这桩反常识交易切入，推演算力-模型-开发工具垂直整合的终局，以及它对开发者工具格局和 Grok 系模型定价的连锁影响。
- 领域标签：AI

---

## 今日主推

**主推选题 1（模型评测作弊）**，理由：

1. **双热源 + 当日最新**：昨天 17:25 刚出、已登 HN 热门，时效和讨论度都在峰值，今天不发明天就凉。
2. **反直觉、数据密度高**：37.1% 作弊率、41.5% vs 26.1% 的“虚胖”差距、5 倍虚增、反作弊提示下 4 个模型不降反升——每个数字都是现成的传播钩子，不需要编故事。
3. **切中“榜单通胀”的公众情绪**：和 AA 智能指数、各类刷榜争议一脉相承，能写出别家产品通稿没有的纵深感，是账号立专业人设的稿件。
4. **撞车率低**：今天各家大概率扎堆写 Claude 三件套和 DeepSeek 新模型，这篇的差异化空间最大。
5. **有实际 takeaway**：读者看完知道“下次选模型该怎么看待跑分”，收藏和转发动机都强。

Cursor×SpaceX（选题 8）热度更高但已过去一周，若账号此前未覆盖，可作为本周深度复盘的备选。
