9月23日,Epoch AI发布家具组装基准测试(FAB)结果。该测试通过60张故意错误组装的宜家家具照片,评估AI对安装说明书的比对与错误识别能力。OpenAI GPT-6 Astra以80%准确率居首,较2025年11月领先模型提升近三倍;推理中位耗时约3分钟,为最快模型。测试涵盖图像理解、空间推理与多步骤指令匹配,旨在模拟维修、安装等现实场景。中国开源模型Kimi K3目前落后国际前沿约7个月,视觉推理仍是短板。
免责声明:本文内容由开放的智能模型自动生成,仅供参考。
9月23日,Epoch AI发布家具组装基准测试(FAB)结果。该测试通过60张故意错误组装的宜家家具照片,评估AI对安装说明书的比对与错误识别能力。OpenAI GPT-6 Astra以80%准确率居首,较2025年11月领先模型提升近三倍;推理中位耗时约3分钟,为最快模型。测试涵盖图像理解、空间推理与多步骤指令匹配,旨在模拟维修、安装等现实场景。中国开源模型Kimi K3目前落后国际前沿约7个月,视觉推理仍是短板。
免责声明:本文内容由开放的智能模型自动生成,仅供参考。