💬 观点Simon Willison
Qwen3.8 27B addition in words — 用本地 DGX Spark 复现 GPT
用本地 DGX Spark 复现 GPT-4o 的「用文字做大数加法」实验,看 Qwen3.8 27B 表现如何
2026-10-04原文
本文为要点摘要,完整细节以原文为准。
- 博主受 Colin Frasier 两年前 GPT-4o 实验启发,在本地 DGX Spark 上用 Qwen3.8-27B-Q4_K_M.gguf 重跑同一实验,全程可控、不依赖云端。对开发者的含义:本地量化模型已能承担这类可复现的评测任务。
- 关闭推理时,每个组合跑 30 次生成热力图;开启推理后耗时大增,改为每格只跑一次,结果非 100% 即 0%。含义:推理模式显著拉长延迟,评测设计需在样本量与成本间取舍。
- 开启推理的一次性测试中 169 次里答对 167 次,报告还附带了逐位对齐、进位的大数加法推理轨迹。含义:显式思维链让模型把算术拆成可检查步骤,但单次样本的结论稳定性有限。
原文:Qwen3.8 27B addition in words · 作者 Simon Willison