OpenAI o3 模型基准测试争议:实际表现与宣称不符

OpenAI的o3人工智能模型在基准测试中表现不佳,实际得分远低于公司宣称的25%正确率,引发外界对其透明度和测试实践的质疑。

9效率工具OpenAI基准测试人工智能模型性能

OpenAI o3 模型基准测试争议

4月21日,OpenAI的o3模型在基准测试中遭遇质疑。该公司曾宣称o3模型能在FrontierMath数学问题集上正确回答超过四分之一的问题,但实际得分仅为约10%,与宣称的25%相去甚远。

Epoch研究所上周公布的独立测试结果显示,o3模型的得分远低于OpenAI声称的最高分数。Epoch指出,测试设置可能与OpenAI有所不同,且评估使用了更新版本的FrontierMath。

OpenAI o3 模型基准测试成绩遭质疑,实测分数远不及宣称插图

ARC Prize基金会也证实了Epoch的报告,指出公开发布的o3模型与测试版本存在差异,计算层级更小。尽管如此,OpenAI后续推出的o3-mini-high和o4-mini模型在FrontierMath上的表现已优于o3。

OpenAI o3 模型基准测试成绩遭质疑,实测分数远不及宣称插图1

这一事件再次提醒我们,在人工智能领域,基准测试结果不应被盲目接受,尤其是当结果来自有产品需要销售的公司时。

其他公司如Epoch和Meta也因基准测试争议而受到批评。OpenAI、Epoch、Meta和xAI等公司均在人工智能领域竞争激烈,基准测试“争议”愈发常见。