DeepSeek V4 Flash Self-Evaluation Filtering Accuracy Rises to 88%, Surpassing Claude Fable 5

来源:TechFlow · 2026-08-18
Anthropic

AI 摘要

一句话摘要: DeepSeek V4 Flash自评筛选将Terminal-Bench准确率提升至88%,超越Claude Fable 5且成本极低。 关键事实: 自评筛选将准确率从79%提升至88%,成本仅为Claude Fable 5的1/11,框架已开源可复现 涉及主体: DeepSeek, Stanford, Claude Fable 5, Terminal-Bench 2.1 可能影响: 验证测试时扩展的实用价值,可能推动低成本自监督优化成为主流,降低高质量推理门槛 噪音/炒作风险: 中,结果来自单一基准测试,自评方法存在过拟合风险,但开源可复现性增强可信度

阅读原文 →

← 更多文章