谷歌 I/O 🔥:GEMINI OMNI FLASH 已发布,现已在 GEMINI 和 GOOGLE FLOW 上可用。 GEMINI OMNI PRO 即将推出 🤩
Omni 将改进的物理理解与 Gemini 在历史、生物和文化方面的知识相结合,弥合了从照片级真实感向有意义叙事的差距。 行动会产生后果,环境会对事件做出反应,叙事会合乎逻辑地演变。
推荐理由:Gemini Omni Flash 是 Google 对多模态生成的新尝试,把物理模拟和历史叙事揉在一起,做视频内容的人可以盯着看。
Google 与 DeepMind 的 AI 动态:Gemini 系列、Veo 视频模型、研究成果与产品生态的持续追踪。
谷歌 I/O 🔥:GEMINI OMNI FLASH 已发布,现已在 GEMINI 和 GOOGLE FLOW 上可用。 GEMINI OMNI PRO 即将推出 🤩
Omni 将改进的物理理解与 Gemini 在历史、生物和文化方面的知识相结合,弥合了从照片级真实感向有意义叙事的差距。 行动会产生后果,环境会对事件做出反应,叙事会合乎逻辑地演变。
推荐理由:Gemini Omni Flash 是 Google 对多模态生成的新尝试,把物理模拟和历史叙事揉在一起,做视频内容的人可以盯着看。
推荐理由:就是 Google I/O 的日程表,提醒你今天该看哪个场次,AI 专场在下午三点半,但推文本身没透露任何新东西,好戏还得等 keynote。
Google 推出 Gemini for Science 项目,发布一系列基于 Gemini 模型的科学工具与实验性应用。该项目旨在扩展科学探索的规模与精度,通过人工智能辅助研究人员处理复杂计算、模拟实验系统并加速数据分析流程。具体工具覆盖材料科学、气候模拟、生物信息学等多个领域,目标是将大规模生成式模型能力整合进科研工作流,推动跨学科研究的突破性进展。
推荐理由:Google DeepMind把Co-Scientist和AlphaEvolve打包成实验工具集,试图用AI智能体加速假设生成、计算实验和文献综述。虽然还只是原型,但这是科学AI走向产品化的信号,科研人员可以试试。
平台宣布扩展其内容透明工具,旨在让用户更便捷地追溯网络内容的创建与编辑历史。这项更新将适用于社交媒体平台、网页内容等多个场景,帮助用户识别信息的修改痕迹,提升数字内容的透明度。
推荐理由:Google 把 SynthID 水印和 C2PA 凭证推向搜索、Chrome 和 API,普通人也能随手查「这是 AI 做的吗?」,这对虚假信息是实际的约束。
Google发布了Gemini 3.5模型,该模型专注于提升执行复杂任务的能力。其核心特点是支持“代理式工作流”,即能够像助手一样自主规划并执行一系列多步骤、复杂的操作,旨在将先进的语言理解与实际问题解决能力相结合。
推荐理由:Gemini 3.5 Flash 把前沿级智能体和编程能力塞进了极低延迟和成本,四倍于竞品速度的同时基准表现超过 3.1 Pro,这可能是今年对开发者最实用的基座模型之一。
Google开源框架Genkit近日推出其核心中间件系统,旨在提升智能体AI应用的可靠性与可控性。该系统允许开发者在生成调用、模型及工具层进行拦截,以注入自定义行为,如重试机制、模型回退以及人工介入的工具审批流程。通过创建并堆叠自定义中间件,开发者能够实现对模型输出的确定性控制。所有中间件的执行流程均可通过专用的开发者界面进行实时查看与调试,有效支持使用TypeScript、Go、Dart和Python构建生产就绪的智能体应用。
推荐理由:Genkit 的中间件系统把 agent 行为变成可编程的拦截点,重试、fallback、人机审批都能挂上,对用 Genkit 上生产的团队来说,是个能让应用更「硬」的更新。
Arm第二代可扩展矩阵扩展(SME2)与Google AI Edge软件栈集成,将CPU转变为强大的矩阵计算加速器,从而实现高性能的设备端生成式AI。本文以Stability AI的“stable-audio-open-small”模型为例,阐述了利用LiteRT、XNNPACK和KleidiAI构建的“转换、优化、部署”自动化硬件加速流程。该方案在基于Arm架构的移动设备和笔记本电脑上,成功实现了音频生成速度提升2倍以上、内存使用减少4倍的显著效果,同时确保了高音频质量。这一集成方案为在资源受限的边缘设备上高效运行复杂AI模型提供了有效路径。
推荐理由:Google 和 Arm 在设备端 AI 上的联合优化案例很具体,给了开发者一套可复制的流程,2x 加速和 4x 内存节省对于做移动端生成式 AI 的人来说值得动手试一下。
Google Cloud 在 SIGMOD 发表论文,提出用代理模型(proxy model)加速 BigQuery 和 AlloyDB 中的 AI 函数。代理模型是面向特定查询和数据微调的轻量级模型,在 10 个基准测试中 F1 分数达到 LLM 的 90%-116%。该优化已默认集成在 BigQuery 和 AlloyDB 的优化模式下。
推荐理由:Google 把数据库里的 LLM 调用换成了超轻量代理模型,成本降了两个数量级且准确度几乎无损,做数据分析和 SQL 的同行该认真看了。
推荐理由:below_threshold:T2 推文门槛 75,当前 finalScore=73
本文探讨了如何从无状态聊天机器人升级为生产级AI智能体,以管理长达数天或数周的企业工作流程(如HR入职)。通过引入Agent Development Kit(ADK),其架构核心采用持久状态机和持久化会话存储,确保智能体在“空闲时间”或服务器重启时永不丢失上下文。系统利用事件驱动的Webhook和多智能体委托机制,实现在暂停期间“休眠”,并在唤醒后以高推理准确性恢复复杂任务,从而构建出具备韧性和可靠性的长时运行智能体系统。
推荐理由:Google 官方手把手教你把无状态 chatbot 升级成能跨天跨周的持久化 agent,状态机和持久会话是两个关键切入点,做过生产环境 agent 的都懂这东西有多刚需。
Co-Scientist 是一款由 Gemini 构建的协作式 AI 助手,旨在帮助科研人员加速科学突破。它通过多智能体(multi-agent)的架构设计,作为研究人员的智能伙伴参与工作流程,以提升研究效率并推动创新发现。
推荐理由:Google DeepMind 推出的科研助手,用多智能体框架帮科学家加速实验设计,如果做生物/材料领域研究,值得跟踪一下,但对其他领域暂时可能还是个概念。
Gemini中的笔记本功能为复杂任务带来条理性。 以研究生院申请流程为例:通过笔记本,您可以将成绩单、文书草稿和录取要求集中在一处,让Gemini帮助追踪截止日期、提供反馈并评估您的进展。
推荐理由:Gemini笔记本像是给ChatGPT加了个项目管理面板,如果你在手里捏着一堆碎片化任务,这个功能值得到回来看看。但别指望它超越模型本身的能力边界。
AlphaEvolve推出了基于Gemini大模型的编程智能体,其算法正驱动多个领域产生实际影响。该智能体在商业流程、基础设施优化与科学研究三个关键领域实现规模化应用,通过自动化代码生成与问题解决提升效率。具体实践表明,它能显著加速开发周期并处理复杂任务,标志着AI编程助手从辅助工具向核心生产力引擎的演进。
推荐理由:DeepMind这次不只是秀参数,AlphaEvolve用Gemini驱动编码代理,已经开始在工业设计和科学发现里产生真实影响了,做自动化的可以盯着看。
推荐理由:Nano Banana 2 把 Gemini 的图像生成从写 prompt 变成了识别你的兴趣,不用费力描述也能出图,对普通用户可能是真痛点,看直播看看实际效果。
@NotebookLM 高级用户的重大新功能:延续 Mind Maps 的传统,Notebook 现在可以自动为你的来源添加标签,这让管理拥有大量来源的笔记本变得容易得多。 我已经用了好几周了,它在大型笔记本中用途惊人地广泛。详情如下。 它的工作方式是这样的。如果你的笔记本中有超过 5 个来源,你会在左侧来源列表上方看到一个新的“auto-label”按钮。点击它,Notebook 将审查你所有来源的内容,并将它们组织成高层级的类别。如果主题有重叠,每个来源可以有多个标签。 标签应用后,你会看到来源的新整洁视图,其中只显示顶层类别,但你可以轻松展开以查看与每个标签关联的所有来源。点击每个标签旁边的三点菜单可重命名或删除标签。(来源不会被删除。)或者添加 emoji 以在视觉上区分标签。你可以点击每个来源旁边的三点菜单,为来源分配不同的标签。 在来源面板中拥有这种有条理的标签视图,让你更容易找到你要找的特定来源,但这只是开始。 你还可以使用来源面板右侧的选择按钮,让 AI 专注于特定类别。选择一个类别后,聊天中的所有回复都将完全基于分配给该标签的来源。如果你担心 AI 被其他类别中的信息分散注意力,这会很有帮助,而且由于加载到上下文中的来源更少,它还可以加快你的聊天响应时间。 按标签选择对于生成 studio artifacts 也超级有帮助。如果你想要一个只聚焦于你的 American History 笔记本中关于内战的来源的播客,只需选择该标签,然后点击 Studio 中的 audio overview 按钮。 标签视图还极大地增强了在拥有许多现有来源的笔记本中的 Fast 和 Deep Research。过去,如果其中一个研究代理添加了一批来源(使用 Deep Research 时最多可达 40 或 50 个),所有来源都会按字母顺序散布在你的来源面板中,无法分辨哪些是新添加的。但现在,如果你所有预先存在的来源都整齐地归档在适当的标签中,当你拉取新的研究来源时,它们都会出现在标签类别下方的字母顺序列表中。这样就能轻松审查这些新来源,看看哪些是你真正想保留的,你可以手动选择它们(并取消选择所有标签),以探索你刚刚添加到笔记本中的新信息。假设你想专门向你的 American History 笔记本添加关于 Battle Of Gettysburg 的新信息——运行一次 Fast Research 查询,导入十个新来源,选择这些新的未标记来源,然后点击 Slide Deck 按钮,对 Gettysburg 的历史进行一次聚焦回顾。 一旦你探索完这些新来源,你随时可以点击左上角原来的 auto-label 按钮,并选择“Reorganize unlabeled sources”。Notebook 将自动为新加入的来源分配合适的标签。 如果你想切换回完整的来源字母顺序列表,只需选择“Return to list view”即可返回传统的来源面板布局。Notebook 会记住你的标签,因此很容易在两种视图之间来回切换。 该功能应在未来几天内向所有用户推出。尽情享用!
推荐理由:NotebookLM的自动标签让管理几十个来源的笔记本不再灾难,特别是和深度研究联动后,能快速聚焦感兴趣的分类直接生成播客,研究人员和深度用户应该会喜欢。
推荐理由:如果你在用 Gemini 搭 RAG 系统,这三项更新能直接改善搜索精度和可解释性,多模态搜索终于把图片和文档打通了,值得马上试试。
据隐私倡导网站报道,Google Chrome 浏览器在未经任何提示或用户同意的情况下,于后台自动下载并安装了一个名为“Nano”、体积达 4 GB 的人工智能模型。该行为旨在增强本地AI功能,但完全隐蔽的安装过程占用了用户设备存储空间,且未提供任何选项或通知,引发了对其数据隐私风险及软件更新透明度的广泛担忧。此事件在Hacker News上获得高度关注,突显了公众对科技公司单方面安装行为的普遍不安。
推荐理由:浏览器里偷偷塞进4GB的AI模型,这件事揭开了一个很多人忽视的趋势,你的设备正在变成AI宿主,而且根本不需要征得同意。
告别持续轮询!在构建复杂、长期运行的智能体应用时,使用 Gemini API 中的 Webhooks 来消除 API 流量的浪费,并简化编排逻辑。🙌
推荐理由:长期轮询是agent开发的隐形税,Gemini API这次内置webhooks,把编排逻辑简化了一大截,做复杂agent的开发者今晚就能删掉一堆轮询代码。
Gemini API 引入了事件驱动的 Webhook 功能,这是一种基于推送的通知系统。它旨在消除低效的轮询需求,为长时运行的任务(如文件处理或复杂推理)提供更优的解决方案。当任务完成时,系统会自动将结果推送到用户指定的端点,从而显著降低延迟并减少资源消耗,提升开发效率与响应速度。
推荐理由:Gemini API 终于补上 Webhooks 这块拼图,长任务不用再轮询等待,对做自动化流程和 Agent 的开发者是实打实的效率提升。
从构想到原型,借助Gemini中的Nano Banana 2,将您独特的产品愿景变为现实。🪀
推荐理由:Google Gemini塞进一个Nano Banana 2创意工具,把想法转原型只需几句话,产品经理脑暴草案利器,算不上重磅但够实用。