什么是 GAIA?
GAIA 是一个用于评估 AI 助手在需要核心能力组合的真实世界任务上的表现的基准,这些核心能力包括推理、多模态理解、网页浏览和熟练的工具使用。
此论文介绍了 GAIA “GAIA: A Benchmark for General AI Assistants”。
该基准包含 466 个精心策划的问题,这些问题对人类来说在概念上简单,但对当前的 AI 系统来说却极具挑战性。
为了说明差距:
- 人类:约 92% 的成功率
- 带有插件的 GPT-4:约 15%
- 深度研究(OpenAI):在验证集上的得分为 67.36%
GAIA 突出了 AI 模型的当前局限性,并提供了一个严格的基准来评估向真正通用 AI 助手发展的进展。
GAIA 的核心原则
GAIA 围绕以下支柱精心设计:
- 现实世界的难度:任务需要多步骤推理、多模态理解和工具交互。
- 人类可解释性:尽管对 AI 来说很难,但每个任务在概念上对人类来说仍然简单易懂。
- 不可游戏化:正确答案需要完整的任务执行,使得蛮力破解无效。
- 评估的简单性:答案简洁、事实性强且明确,作为一个理想的基准测试。
难度等级
GAIA 任务被组织为三个递增复杂度的等级,每个等级测试特定技能:
- 一级:需要少于 5 个步骤和最少的工具使用。
- 二级:涉及更复杂的推理和多个工具之间的协调以及 5-10 个步骤。
- 三级:需要长期规划和各种工具的高级集成。
困难 GAIA 等级(Hard GAIA)的问题示例
在 2008 年画作“乌兹别克斯坦的刺绣”中展示的水果中,哪些曾在 1949 年 10 月的早餐菜单中被提供,作为后来用于电影《最后航程》的远洋班轮的一部分?请将这些水果以逗号分隔的列表形式给出,按照它们在画作中从 12 点位置开始的顺时针排列顺序,并使用每种水果的复数形式。
正如你所见,这个问题在几个方面对 AI 系统提出了挑战:
- 需要一个结构化的响应格式
- 涉及多模态推理(例如,分析图像)
- 需要多跳检索相互依赖的事实:
- 识别画作中的水果
- 发现哪个远洋班轮用于《最后航程》
- 查找该船 1949 年 10 月的早餐菜单
- 需要正确的排序和高级规划以按正确顺序解决
这种任务突出了单独的 LLM 往往不足的地方,使 GAIA 成为基于智能体的系统的理想基准,这些系统可以在多个步骤和模态上进行推理、检索和执行。
实时评估
为了鼓励持续的基准测试,GAIA 在 Hugging Face 上提供了一个公共排行榜,你可以在其中测试你的模型对 300 个测试问题的表现。
在这里查看排行榜。
小结
- GAIA 是评估通用 AI 助手在真实世界任务上表现的基准,覆盖推理、多模态、网页浏览与工具使用等能力。
- 466 个任务对人类简单、对当前 AI 极具挑战(人类约 92%,带插件 GPT-4 约 15%)。
- 四大核心原则:现实世界难度、人类可解释性、不可游戏化、评估简单性。
- 难度分三级,复杂度与工具协调要求递增。
- 适合作为基于智能体的系统的评测基准,单一 LLM 难以完成其多跳、多模态任务。