跳到正文
北京时间
原文
xAI:News(网页)·· 2024-04-12精选

Grok-1.5 Vision 预览版

Grok-1.5 Vision Preview

AI 导读

xAI 发布 Grok-1.5 Vision 预览版,新增视觉理解能力,可处理图像、图表及文档内容,支持跨模态推理与视觉问答,现面向早期测试者开放试用。

推荐理由

xAI发布Grok-1.5 Vision预览版,具备多模态视觉理解能力

正文 · AI 翻译

Grok-1.5 Vision 预览版

通过我们的首个多模态模型,连接数字世界与物理世界。


能力:对真实世界的理解,迈向未来

推出 Grok-1.5V,这是我们第一代多模态模型。除了强大的文本能力外,Grok 现在还能处理多种视觉信息,包括文档、图表、示意图、截图和照片。Grok-1.5V 将很快向我们的早期测试者和现有 Grok 用户开放。

能力

Grok-1.5V 在多个领域与现有的前沿多模态模型具有竞争力,涵盖多学科推理、文档理解、科学图表、示意图、截图和照片等。我们尤其对 Grok 理解物理世界的能力感到兴奋。在我们新推出的用于衡量真实世界空间理解能力的 RealWorldQA 基准测试中,Grok 的表现优于同类模型。对于以下所有数据集,我们均在零样本设置下对 Grok 进行评估,且不采用思维链提示。

基准测试 Grok-1.5V GPT-4V Claude 3 Sonnet Claude 3 Opus Gemini Pro 1.5
MMMU 多学科 53.6% 56.8% 53.1% 59.4% 58.5%
Mathvista 数学 52.8% 49.9% 47.9% 50.5% 52.1%
AI2D 图表 88.3% 78.2% 88.7% 88.1% 80.3%
TextVQA 文本阅读 78.1% 78.0% - - 73.5%
ChartQA 图表 76.1% 78.5% 81.1% 80.8% 81.3%
DocVQA 文档 85.6% 88.4% 89.5% 89.3% 86.5%
RealWorldQA 真实世界理解 68.7% 61.4% 51.9% 49.8% 67.5%

示例

根据图表编写代码

用户

你能把这个翻译成 Python 代码吗?

Grok

当然可以!您提供的流程图描述了一个简单的猜数字游戏:计算机生成一个随机数,用户需要猜出这个数字。以下是实现该流程图逻辑的 Python 代码:

import random

def guess_number(): # Generate a random number between 1 and 10

    target = random.randint(1, 10)

    while True:
        guess = int(input("Guess a number between 1 and 10: "))

        if guess == target:
            print("You won!")
            break
        else:
            print("Wrong guess, try again!")

if __name__ == "__main__":
    guess_number()

这段代码将按照流程图中的描述运行猜数字游戏。系统会提示用户输入猜测,直到猜中正确的数字为止。

真实世界理解

为了开发有用的真实世界 AI 助手,提升模型对物理世界的理解至关重要。为此,我们推出了一项新的基准测试——RealWorldQA。该基准测试旨在评估多模态模型对真实世界基本空间理解的能力。尽管当前基准测试中的许多示例对人类来说相对容易,但它们往往对前沿模型构成挑战。

哪个物体更大,是披萨刀还是剪刀?A. 披萨刀更大。B. 剪刀更大。C. 它们大小差不多。

从当前车道我们可以去哪里?A. 左转。B. 直行。C. 左转和直行。D. 右转。

根据我们轿车的这个前置摄像头视角,我们是否有足够的空间绕过前方那辆灰色汽车?A. 有。B. 没有。

根据这张图片,恐龙面向哪个基本方向?A. 北。B. 南。C. 东。D. 西。

RealWorldQA 的初始版本包含超过 700 张图片,每张图片都附带一个问题和一个易于验证的答案。该数据集包含来自车辆拍摄的匿名图像,以及其他真实世界的图像。我们很高兴向社区发布 RealWorldQA,并计划随着我们多模态模型的改进而扩展它。RealWorldQA 采用 CC BY-ND 4.0 许可协议发布。点击此处(677MB)下载数据集。

展望未来

提升我们的多模态理解和生成能力,是构建能够理解宇宙的有益 AGI 的重要步骤。在接下来的几个月里,我们预计将在图像、音频和视频等多种模态上,使这两种能力都取得显著进步。

如果你想加入这段旅程,我们正在招聘。

复制深色 SVG

复制浅色 SVG

来源:xAI:News(网页) · x.ai