夏洛特的夏天

生活

这周周五、周六,夏洛特特别闹,街上全是人。我下楼瞧瞧。路封了,一个黑人大姐守在路边路障那儿,我俩聊起来。她说 Savannah Bananas 跟另一支球队在城里打比赛,边上还有一堆娱乐活动,人都出来玩了。

聊着聊着说到美国流行文化。我打篮球,棒球规则其实不太熟。她来自加勒比一个小岛,以前在布鲁克林住过。篮球、棒球、足球、橄榄球、美式足球,扯了一圈。她说上周这儿也办过足球活动,同样人山人海——我有印象。

晚上还有夜市。摊位起码上百家,亚洲脸孔我就看见两三个。有人悄悄跟我说怎么算账:展位三天一千刀,一个 token 两块,一碗云吞四个 token,主办方跟摊主五五分。我说下回也许也来申个摊。吃了几碗要给钱,人家不要,我还是在桌上留了二十块。

AI

不可压缩知识探针

Bojie Li 那篇 Incompressible Knowledge Probes(不可压缩知识探针:用事实容量估黑盒大模型参数量)最近闹挺大,也挺像眼下 AI 圈:真东西、炒作、烂方法论、迷信规模,全搅一块。预印本一出来就说 GPT-5.5 有 9.7 万亿参数,Claude Opus 4.6 有 5.3 万亿,Gemini 3.1 Pro 更离谱到 40 万亿。我偶尔花几个小时调 vLLM、写 PagedAttention,就为 GPU 集群多挤一点吞吐——这些数和硬件对不上。

后来 METR 的 Benjamin、Lawrence 写了篇复核:Sanity-checking "Incompressible Knowledge Probes"。读着过瘾。原想法不笨:看模型能记住多少冷门、难压缩的事实,跟开源模型做回归,往外推参数量。难在执行。代码库几乎 Claude Code 生成的,「AI slop」一堆,没人认真验——这本身就很说明问题。

他们揪出一个要命 bug:评分里藏着 floor=0。小模型(Qwen、DeepSeek 那些)胡说八道的惩罚被封顶,大小模型的差距被人为压扁;回归线下界抬高了,斜率变平,前沿模型表现一好,外推参数量只能往天上飞。

去掉这个地板、把题目里含糊的表述理一理(有些题反而罚前沿模型答得太细),数字就下来了:GPT-5.5 缩 6.6 倍,大约 1.5 万亿;Claude Opus 4.7 大约 1.1 万亿。

大模型参数量的谎言

纠偏有必要,但也不是铁证,Li 的回归说不定又摆到另一头。闭源前沿模型,没有哪家实验室公布过权威参数量;OpenAI、Anthropic、Google 都把规模和架构当机密。外面能看的,无非是泄露、第三方猜,再加 LifeArchitect.aiDoDataThings 这篇「The LLM Parameter Lie」 之类——到 2026 年初,也就这些了。

凑起来比 Twitter 标题合理,每个数仍得打问号。GPT-4 多半是 MoE,总量约 1.76 万亿,每个 token 激活约 2800 亿,绝大部分权重平时闲着。Claude Opus 4.x(4.6 / 4.7)独立分析也在这档:MoE,总量约 5 万亿GPT-5、GPT-5.5、Gemini 3.1 Pro 仍是一片黑;Li 论文里的 9.7T、40T 是方法论搞砸了,不是披露。Claude Mythos 5 还没发,2026 年 3 月 Anthropic 内部草案漏出来,报道 说是 10 万亿 总量,MoE 路由下每次前向激活大概 8000 亿到 1.2 万亿——吓人,但不是你该照着买机器的数字。

行业风向也变了。DoDataThings 那篇 大模型参数量的谎言 说得直:前沿模型几乎全是 MoE,10T 也可能每次只用一小撮权重。另一条轴是推理时计算o4-mini 参数量估在 100B–300B,AIME 202592.7%,不是更会背,是推理时多想了会儿。闭源顶尖模型总量多半落在 2T–5T(Mythos 5 追极端是例外);真部署看激活多少参数推理肯花多少算力,不是幻灯片上的虚荣数。

推理时计算

堆参数硬顶的时代过去了,MoE 加推理时计算才值得盯。做资本市场风险计算,不需要十万亿参数的百科全书,冷门事实背得再全,反应快、爱联想,随机微积分一换花样就胡说。衍生品定价、房贷建模、动态风险仿真,得慢慢推、反复验、错了退回重算。

训练时不必把天下逻辑塞进权重;推理时再砸算力。小模型走思维链、树搜索试几条路、自校正一遍,再吐 Python 或风险指标——量化同事平时也这样,奇异期权哪有一口价,先推、查边界、负号漏了再算。

一千亿参数的基础模型,给六十秒想,常能赢万亿模型被逼秒答。扩展定律从训练算力横轴,挪到推理算力纵轴。C++、Python 后端跑异步长循环,挂便宜开源模型,接稳 Python 环境,推理时多算一会儿去顶定价引擎,往往比稠密巨模型的天价 API 划算。

写在最后

想了一圈,方向又清楚点。网上永远追最大参数、最炫 benchmark、最炸的预印本;管用还是效率、评估严、系统会推理而不只会背。