跳到正文
北京时间

Google / Gemini

Google 与 DeepMind 的 AI 动态:Gemini 系列、Veo 视频模型、研究成果与产品生态的持续追踪。

最新精选

第 281–300 条 · 共 316 条
3月24日周二
  1. Google Developers Blog(RSS)71

    跳跃即玩:利用Gemini与MediaPipe进行开发

    该工作流通过Gemini Canvas,借助高级提示词快速原型化MediaPipe Pose Landmarker等体感游戏机制。开发者可在Google AI Studio中优化原型,采用低延迟的“轻量”模型和稳定的追踪点(如肩部关节点)以确保游戏响应灵敏。最后,流程利用Gemini Code Assist将实验性代码重构为模块化、可用于生产的应用程序,使其能够支持多种多模态输入,从而显著简化了体感控制游戏的开发过程。

    推荐理由:开发者可快速上手AI游戏开发,优化性能并部署生产应用。

3月23日周一
  1. Google Developers Blog(RSS)71

    使用 LlamaParse 与 Gemini 3.1 构建智能金融助手

    结合 LlamaParse 与 Gemini 3.1 模型,可从复杂的非结构化文档中提取高质量数据。该方案采用事件驱动架构,利用 Gemini 3.1 Pro 对密集的金融表格进行智能解析,并使用 Gemini 3.1 Flash 进行高性价比的摘要生成。开发者通过此教程可构建个人财务助手,将杂乱的经纪账户对账单转化为结构清晰、易于理解的分析报告。

    推荐理由:开发者可快速上手构建财务AI助手,将杂乱数据转化为结构化见解。

3月21日周六
3月19日周四
  1. Demis Hassabis

    Google 发布 vibe design 平台 Stitch,支持自然语言描述直接生成高保真界面和交互原型,可通过语音实时调整布局。目前仅面向 18 岁以上用户,在 Gemini 支持的英语国家开放。

    引用Google Labs@GoogleLabs

    隆重推出全新的 @stitchbygoogle,这是 Google 的 vibe 设计平台,可将自然语言无缝转化为高保真设计,一气呵成。 🎨用更智能的设计代理进行创作:描述一个新的商业概念或应用愿景,看它在 AI 原生画布上逐渐成形。 ⚡️ 快速迭代:将屏幕拼接成交互式原型,并用可移植的设计系统管理你的品牌。 🎤 用语音协作:使用免手操作的语音交互实时更新布局并探索新的变体。 立即试用(仅限 18 岁以上。目前仅提供英文版本,且仅在支持 Gemini 的国家/地区可用。)→ http://stitch.withgoogle.com

    推荐理由:Google推出AI设计工具Stitch,自然语言生成界面并支持语音协作,顺应Vibe Design趋势

3月18日周三
  1. PromptArmor:Threat Intelligence67

    PromptArmor 分析 Excel 与 Google Sheets 中 AI 功能的提示词注入与数据外泄风险

    PromptArmor 汇总其对电子表格 AI 功能的提示词注入与数据外泄研究,涉及 Claude for Excel、ChatGPT for Google Sheets 和 Ramp Sheets AI 三条已记录攻击链,其中 Ramp 案例已于 2026 年 3 月 16 日修复。

    推荐理由:原文基于多起已披露攻击链,归纳出电子表格 AI 的间接提示词注入风险面,并给出可复用的威胁模型和风险来源清单。

  2. Google Developers Blog(RSS)81

    开发者AI代理协议指南

    一套包含MCP、A2A等六种协议的新工具集正式发布,旨在通过标准化AI代理的数据访问与通信方式,消除定制集成代码的需求。以“厨房管理员”代理为例,这些协议能实时核查库存、通过UCP进行批发交易,并借助AP2完成安全支付授权。开发者使用Agent开发套件(ADK)还可实现A2UI与AG-UI,为用户提供交互式仪表板与无缝流式界面。

    推荐理由:开发者能快速掌握AI代理通信标准,提升集成效率。

3月10日周二
3月5日周四
3月4日周三
2月27日周五
2月20日周五
  1. Noam Shazeer78

    上周我们升级了 Gemini 3 Deep Think。今天,我们正式推出实现这些突破的核心智能:Gemini 3.1 Pro。一个明显更智能、能力更强的基线,应对你最艰巨的挑战。现已可用:https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-1-pro

    推荐理由:Noam Shazeer 宣布 Gemini 3.1 Pro,作为 Deep Think 突破背后的核心基座升级,全行业该关注的信号。

12月17日周三
  1. Google DeepMind:Blog(RSS)

    Gemini 3 Flash:专为速度打造的前沿智能

    Gemini 3 Flash 正式发布,在大幅降低使用成本的同时提供前沿级智能,主打极速推理性能,为需要快速响应的 AI 应用提供高性价比选择。

    推荐理由:Google发布Gemini 3 Flash轻量模型,兼顾前沿性能与推理速度

11月26日周三
  1. Dan Hendrycks78

    AI 安全研究者 Dan Hendrycks 在 X 上发布对 Claude Opus 4.5 与 Google Gemini 3 的横向评测,包含文本、视觉与安全三个维度的指数得分。结果显示:在控制推理令牌数后,两者文本能力相当;Gemini 3 在图像/视觉任务上显著领先;而 Opus 在对抗性测试(如越狱、诚实性)中表现更优。图表显示了 7 模型的文本能力(Gemini 3 Pro 47.6 领先)、视觉能力(Gemini 3 Pro 57.1 最高)及安全指数(Opus 33.6 最低,即最安全)。

    推荐理由:该评测由知名 AI 安全研究者主导,数据维度全面(文本、视觉、安全),且直接对比当前头部模型,为读者提供了可量化的横向参考;尤其安全指标反常识(越低越好),有助于理解“能力”与“安全性”的权衡,对选型和风险评估有实用价值。

11月20日周四
  1. Google DeepMind:Blog(RSS)

    Google DeepMind 发布 Nano Banana Pro 图像生成模型

    Google DeepMind 发布 Nano Banana Pro 图像生成模型,基于 Gemini 3 Pro 构建,支持多语言可读文本直接渲染,可结合 Google Search 实时信息生成信息图表。该模型支持 14 张图像融合,保持 5 个人物形象一致性,输出 4K 分辨率。现已集成至 Gemini 应用、Google Ads、Google AI Studio 等产品,所有生成内容均嵌入 SynthID 水印以确保透明度。

    推荐理由:Google 发布 Nano Banana Pro 图像生成模型,支持多语言文本渲染与 4K 输出

  2. PromptArmor:Threat Intelligence73

    PromptArmor 演示 Google Antigravity 经间接提示词注入窃取用户凭据和代码

    PromptArmor 发布研究,演示 Google Antigravity(Google 的 agentic 代码编辑器)可通过间接提示词注入被操纵,调用浏览器子代理将用户凭据和代码外泄到攻击者控制的 webhook.site 地址。

    推荐理由:作者以第一手复现展示 Google Antigravity 被间接提示词注入窃取凭据的完整链条,并指出默认 Allowlist 含 webhook.site 等关键细节。

  3. Dan Hendrycks85

    AI 研究者 Dan Hendrycks 在 X 上宣布发布「文本能力指数」与「视觉能力指数」两个新基准,用于追踪 AI 模型进展。图表显示 Gemini 3 Pro 在两项指标中均显著领先,文本能力得分 46.5,视觉能力得分约 57;其性能跃升幅度被作者称为‘长期最大飞跃’。榜单共涵盖 7 模型,包括 GPT-5.1、Sonnet 4.5、GroK 4 等。

    推荐理由:该基准由知名 AI 安全研究者主导,具有较高公信力;首次系统性量化对比多模型在推理、编码、视觉等核心能力上的表现,尤其凸显 Gemini 3 Pro 的突破性进步,为公众和行业提供了权威参考依据,值得关注。

11月13日周四
11月5日周三
  1. Dan Hendrycks80

    Dan Hendrycks 在 X 上转发了关于 HLE(Humanity's Last Exam)测试的讨论,称有消息称 Gemini 3.0 Pro 在该测试中得分68%。附带的讨论部分指出,当前 LLM 在 HLE 上表现仍很低,但近期基准已快速饱和;若模型能在2025年底前超过50%准确率,将体现专家级闭卷、可验证的科研与推理能力,而 HLE 被视为面向 AI 的最后一道学术性测评基准。

    引用Techikansh@techikansh

    有传言说—— Gemini 3.0 Pro 在 HLE [人类最后的考试] 中得分 68%

    推荐理由:HLE 是一个聚焦技术知识与推理能力的高难度学术基准,其设计意图是衡量模型是否具备真正‘科学智能’而非仅靠模式匹配。该消息首次公开披露主流大模型在该基准上的实测分数,且由领域权威学者发布,具有较高可信度和参考价值,对判断当前 AI 真实能力边界至关重要。

10月26日周日
  1. Google DeepMind:Blog(RSS)

    MedGemma:健康 AI 开发领域最强的开源多模态模型

    谷歌 MedGemma 系列新增多模态模型,专为健康 AI 开发设计。作为该系列迄今最强的开源版本,新模型具备更强大的医疗场景理解能力,为开发者提供先进的医疗人工智能技术支持,助力构建更精准的健康医疗解决方案。

    推荐理由:DeepMind发布最强开放医疗多模态模型,支持开发者微调构建健康AI应用