Hugging Face AI Sheets 新增视觉支持,可在表格中分析、生成和编辑图像
Unlock the power of images with AI Sheets
Hugging Face 发布 AI Sheets 重大更新,为开源无代码工具 AI Sheets 加入视觉能力,可直接上传图片或使用含图数据集,用视觉模型提取、分析和结构化图片信息。
官方公告给出了图像提取、生成和编辑的具体用法与模型对比示例,读者可以判断能否把图片处理搬进表格工作流。
🧭TL;DR:Hugging Face AI Sheets 是一款开源工具,可用 AI 模型为数据集强力赋能,无需编写代码。现已支持视觉功能:从图像(收据、文档)中提取数据、根据文本生成视觉内容,以及编辑图像——全部在电子表格中完成。由 Inference Providers 提供的数千个开放模型驱动。
我们很高兴发布 Hugging Face AI Sheets 的重大更新,这是一款使用开放 AI 模型构建、转换和丰富数据的开源工具。AI Sheets 利用 Inference Providers,这意味着你可以使用由全球顶尖推理提供商驱动的数千个开放模型。
AI Sheets 的第一个版本让文本内容的结构化和丰富变得轻而易举。现在,我们为 AI Sheets 加入了视觉功能。
图像无处不在——产品照片、收据、截图、图表、图形、标志。这些文档中蕴含着等待被提取、分析和转换的结构化信息。现在,你终于可以直接在 AI Sheets 中处理视觉内容:查看图像、分析图像、提取信息、生成新图像,甚至实时编辑图像——全部在同一工作流中完成。
你的图像有故事要讲
图像中蕴含着宝贵的信息——产品目录、支持工单、研究档案、收据、文档。现在你可以直接上传图像或使用包含图像的数据集,并使用视觉模型来提取、分析和结构化其中的信息。
你可以做什么:
- 描述和分类图像 - 为产品照片生成说明文字、对文档类型进行分类,或按内容为图像打标签
- 提取结构化数据 - 从收据中提取行项目、从图表中提取数据,或从扫描文档中提取文本
- 添加上下文和元数据 - 自动为图像标注相关属性、质量评分或自定义注释
就像文本列一样,你可以迭代提示词、手动编辑输出,并使用点赞来教会模型你想要的结果。你的反馈会成为少样本示例,以获得更好的结果。
示例:从收据到结构化支出
想象一下,你旅行归来,带着一叠收据。将它们上传到 AI Sheets,并创建一个带有如下提示词的列:Extract the merchant name, date, total amount, and expense category from this receipt
AI Sheets 会处理每张收据,并为你生成一个包含所有提取细节的整洁表格。你可以编辑任何错误,通过点赞验证好的结果,并重新生成以改进其余部分。将最终数据集导出为 CSV 或 Parquet,用于你的支出跟踪工具。
或者,你正在将旧家庭笔记本中的手写食谱数字化。创建列来提取食材、烹饪时间和菜系类型——将你的个人档案变成可搜索的结构化数据集。
在同一流程中生成和转换文本与图像
需要为你的内容配图?AI Sheets 可以使用 AI 模型直接在电子表格中生成和编辑图像,将你的整个内容创作工作流集中在一处。
你可以做什么:
- 从文本生成图像 - 创建与你的内容匹配的社交媒体图形、缩略图或插图
- 编辑和转换现有图像 - 修改上传的图像或生成的视觉内容——更改风格、添加元素、调整构图
- 大规模创建变体 - 生成多个版本或风格,以测试哪种能引起受众共鸣
- 构建视觉内容库 - 为大型内容活动制作一致的品牌素材
示例:创建带视觉内容的内容日历
假设你正在规划一个月的关于健康食谱的社交媒体帖子。你有一个包含帖子标题和描述的电子表格,但还没有图片。
创建一个图像列,使用类似这样的提示词:为以下内容生成一张诱人的美食照片:{{title}}。风格:明亮、俯拍、自然光。
AI Sheets 会为每个帖子生成一张独特的图片。不太满意?创建另一列来编辑它们:将图像转换为质朴的木质背景,并添加新鲜香草作为点缀。
你可以对生成和编辑提示词进行迭代,并尝试不同的方法。你的整个内容日历——文案和视觉内容——都存在于一个电子表格中,随时可以安排发布或导出。
分步指南
现在让我们看看 AI Sheets 的实际应用。我们将使用开放模型来解锁手写食谱中的知识,就像你从祖母那里找到的那种。
上传你的数据
我们有一个包含照片的文件夹,可以直接上传到应用中。
结果就是这样一个电子表格:
了解 AI 操作
电子表格中的每一列都可以使用 AI 操作进行转换、提取、查询,以及任何你能想象到的操作。
要查看实际效果,请点击任意列上方的叠加层:
图像列附带图像操作,如提取文本、询问图像、对象检测、着色、添加文本,以及任何你能想到的自定义操作。
文本列包括摘要、关键词提取、翻译和自定义操作。
提示词和模型定义了每一个 AI 操作。让我们看看能用我们的手写食谱数据集做些什么!
从图像中提取文本。
AI Sheets 附带了一个从图像中提取文本的模板:
此操作的结果是一个 AI 生成的列,包含转录的文本。让我们看一个例子:
对于上面的图像,提取的文本如下:
MEMORANDUM:
From
To
1 Box Duncan Hines Yellow Cake Mix
1 Box instant lemon pudding
2/3 cups water
1/2 cup Mozola oil
4 eggs
Lemon flavoring to taste.
Put in mixing bowl and beat for 10 min.
and REMEMBER... for Quality PRINTING
CALL OR WRITE
Gatling & Pierce
PRINTERS
TELEPHONE 332-2579
22 YEARS OF SERVICE IN NORTHEASTERN CAROLINA
不错!但我们看到它包含了页眉和页脚的印刷文本,而我们感兴趣的是食谱文本。包含这些文本的原因是我们使用了默认的文本提取模板,如下所示:
Extract and transcribe all visible text from the image, including signs, labels, documents, or any written content
现在让我们尝试一个自定义提示词。
以下是提取的食谱详情:
- 1 盒 Duncan Hines 黄蛋糕粉
- 1 盒速溶柠檬布丁
- 2/3 杯水
- 1/2 杯 Mazola 油
- 4 个鸡蛋
- 适量柠檬调味料
- 放入搅拌碗中搅拌 10 分钟
这很棒!但更复杂的图像呢?默认情况下,AI Sheets 使用速度和准确性良好平衡的模型,但你可以尝试数千种模型。上面的例子使用了默认的视觉语言模型 Qwen/Qwen2.5-VL-7B-Instruct。
让我们用一个更具挑战性的图像来测试一个 SoTA 推理模型 Qwen/Qwen3-VL-235B-A22B-Reasoning。
以下是模型之间的比较:
| Qwen/Qwen2.5-VL-7B-Instruct | Qwen/Qwen3-VL-235B-A22B-Reasoning |
|---|---|
| 在大碗中混合肉、洋葱、面包屑 1/2 肉豆蔻和奶酪 - 边加边撒。然后搅拌 - 最后再撒上搅拌。在大平底锅中以 350 度烤 10-15 分钟。食用前静置 5 分钟。 | 在大碗中混合肉、洋葱、面包屑 1/4 肉豆蔻和奶酪 - 边加边撒。然后搅拌 - 最后菠菜再搅拌。在大平底锅中以 350 度烤 50-60 分钟 - 食用前静置 5 分钟 |
两个模型生成的输出非常相似,但有两个细微却重要的细节(以粗体显示):温度和一种关键配料:菠菜。
清理、转换和丰富文本
一旦我们对提取的文本感到满意,就可以进一步转换和丰富它。我们需要使用新列执行如下 AI 操作:
现在,每个食谱都有一个结构精美的 HTML 页面:
编辑和转换图像。
最后,AI Sheets 集成了像 Qwen-Image-Edit 这样的图像到图像模型。这意味着你可以运行 AI 操作来转换和丰富你的图像。
例如,假设你想给你的食谱赋予一种复古风格,你需要转到该列并使用 B&W 模板,如下所示:
结果:
导出你的数据集
一旦你对新数据集感到满意,就把它导出到 Hub!你可以将其导出到组织、你的个人资料,或者如果你不想与社区分享,也可以将其设为私有。
你可以查看我们刚刚创建的数据集。
接下来做什么?
你可以试用 AI Sheets,无需安装或下载,也可以从 GitHub 仓库在本地部署。要在本地运行并充分利用它,我们建议你订阅 PRO 并获得 20 倍的每月推理用量。
如果你有问题或建议,请在 Community 标签页中告诉我们,或通过在 GitHub 上提交 issue。
来源:Hugging Face:Blog · huggingface.co












