撞名Anthropic的“外挂”刷屏:让“DeepSeek V4‑Pro碾压 Fable 5”但无人能复现,Token开销反而翻倍
社区项目J-Space Cognition Suite近日在X平台引发关注。该项目声称在不修改DeepSeek V4-Pro-0813模型权重的前提下,仅通过推理时Harness即可显著提升多项Agent Benchmark成绩,甚至超越Fable 5。项目方公布的数据显示,加入该套件后,Terminal-Bench 2.1得分从87.9升至90.1,NL2Repo从61.5升至73.4,Toolathlon-Verified最高从74.1升至79.5。然而,截至8月18日,所有提升数据均出自项目方自身测试,尚无独立团队复现。此外,该套件与Anthropic此前公布的J-space可解释性研究无关,两者技术对象和用途完全不同。开发者指出,该套件本质是模型外部的技能插件,有用户尝试后反馈无法复现结果,且Token开销反而翻倍。
本文摘要由千智坊基于公开报道整理,查看完整内容:阅读原文(InfoQ)→
