模型悄悄”变笨”怎么抓?Livenerf用90道冻结题盯梢30天,给AI编程工具装上测谎仪

HN 一天 833 分、347 条评论,一个叫 livenerf 的开源项目最近刷爆了程序员社区。它要回答的问题只有一个:你付钱订阅的那个模型,上线之后有没有被悄悄”降级”?

疑云重重的”发布后降级”

过去几个月,Anthropic 社区一直有传言:Claude 系列模型发布一两周后,能力会出现神秘下滑。量化换档、同名的更小模型、思考预算下调、路由策略变更,猜测满天飞。反对者的说法同样简单——你只是在拿噪声当规律。

争论卡在一个点上:没人手里握着一份发布当天的干净基线。所有对比都建立在”我印象里它以前更快”这种记忆之上。Claude Opus 5.5 在 2026 年 9 月 22 日发布,GitHub 用户 ninjahawk 决定抓住这次机会,从第一天开始记表。

一套刻意”无聊”的工程

livenerf 的设计哲学写在 README 第一句:小型、无聊、只增不改(append-only)。它不追新意,只追求扛得住恶意审视。

技术上并不复杂。整个项目用 Python 3.11+ 写成,依赖 uv 管理环境,跑在 Inspect 之上——这是英国 AI 安全研究所(AISI)开源的评测框架。调用方式走无头 Claude Code 的 `claude -p` 模式,直接吃 Max 订阅额度,不需要 API key。

大模型本身没法做到确定性:采样参数拿掉,思考模式也关不掉。livenerf 的做法是把其余一切钉死:

  • 冻结题板:题面保密,仓库里只公开哈希值,杜绝题库泄漏;
  • 钉死 CLI:版本锁在 2.1.280,任何 Claude Code 更新都会让运行器直接拒绝执行——工具链一变,测出来的就是工具的变化,和模型无关;
  • 每题配纯函数评分器,阈值提前预注册(协议 v2);
  • 原始日志永久保留,图表全部从日志生成。

统计方法也懒得自创,直接沿用 Anthropic 自家的论文《Adding Error Bars to Evals》(arXiv 2411.00640):主指标是配对逐题分差加聚类标准误,题目难度因素被消掉。拿官方论文当标尺,等于把”你的统计不对”这条反驳路也堵上了。

30 天时间表怎么排

整个实验跑 30 天,每天 90 道题。第 1 天是 2026 年 9 月 24 日,比模型发布晚约 2.5 天。前 10 天采集基线,之后是两个 10 天观察窗口,第一次正式判定定在 2026 年 10 月 24 日前后。

题板经过校准筛选:只有那些模型”有时对有时错”、正确率落在 30%–70% 区间的题才有资格入选——太简单或太难的题都测不出漂移。截至 9 月 27 日的进度显示,4 天全部跑满 90 题,运行在同一个 harness 哈希(461391b6fce64167)上,一天没漏。

作者还埋了一个自己最看重的次级信号:每题输出 token 数的中位数。模型如果开始”偷懒少想”,token 量会先掉,往往比准确率变化更早露头。

开发者能抄走什么

抛开结论,这个仓库对写 Python 的人是份不错的工程样本。定时任务用 cron 驱动 daily.sh,预算守卫只读订阅的 /usage 百分比,保证评测永远占固定份额、不和日常使用抢额度。分析目录里的配对差值与聚类标准误实现,可以直接搬到自己的 A/B 实验里。

对依赖 AI 编程工具的团队,它还提示了一件更实际的事:你的 Agent 质量可能在你不注意的时候漂移。版本号没变,体感变了。稳妥做法有三条——钉住 CLI 和模型版本、给自己保留一份可复现的基准、盯着输出 token 量的异常波动。

livenerf 明确说自己只是一个模型、一套工具、一条干净时间序列,既不是排行榜,也不是评测框架。所有代码和原始数据公开,题板条目只发哈希。第一份判定表会在 10 月底出现。到那天,”模型被 nerf 了”这句话,终于可以靠数据说话。


评论

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注

苏ICP备2025163703号-2   警徽苏公网安备32010502011527号