Gemini 2.5 Flash-Lite 正式发布,可用于规模化生产
Gemini 2.5 Flash-Lite 结束预览,达到生产级可用状态。这款高性价比模型在轻量体积下提供高质量输出,支持 100 万 token 超长上下文和多模态能力。
推荐理由:Google轻量模型Gemini 2.5 Flash-Lite正式版发布,百万上下文多模态兼顾成本效益
Google 与 DeepMind 的 AI 动态:Gemini 系列、Veo 视频模型、研究成果与产品生态的持续追踪。
Gemini 2.5 Flash-Lite 结束预览,达到生产级可用状态。这款高性价比模型在轻量体积下提供高质量输出,支持 100 万 token 超长上下文和多模态能力。
推荐理由:Google轻量模型Gemini 2.5 Flash-Lite正式版发布,百万上下文多模态兼顾成本效益
集成 Deep Think 的 Gemini 高级版本在国际数学奥林匹克(IMO)中达到金牌水平。IMO 自1959年起每年举办,是全球最顶尖的青年数学家竞赛,各国派出6名精英学生角逐代数、组合、几何和数论领域的6道极难题目。
推荐理由:Gemini Deep Think在IMO数学竞赛达到金牌标准,推理能力获重大突破
CodeMender 是一款面向代码安全的 AI 智能体,利用先进 AI 技术自动修复关键软件漏洞。
推荐理由:DeepMind 发布代码安全 AI Agent CodeMender,可自动修复关键软件漏洞
Gemma 3 系列新增 270M 参数模型,仅 2.7 亿参数,定位紧凑型超高效 AI 专业工具。
推荐理由:Google 发布 270M 超小参数开源模型,端侧部署新选择
Gemini 2.5 Computer Use 模型基于 Gemini 2.5 Pro 构建,专门用于驱动能与用户界面交互的 agent,现已通过 API 以预览版形式提供。
推荐理由:Google 发布 Gemini 2.5 Computer Use 模型,支持 Agent 自主操作图形界面
新博客文章(链接见下)。这篇不是随笔,而是一项关于LLM如何权衡不同生命的调查。 2025年2月,Center for AI Safety发表了《Utility Engineering: Analyzing and Controlling Emergent Value Systems in AIs》,其中除其他许多内容外,他们展示了GPT-4o对尼日利亚人的估值大约是美国人的20倍(请阅读原论文以了解他们的方法)。我觉得这非常有趣,并想用更新的模型在不同类别上测试他们的方法。 重大发现1:几乎所有模型都认为白人的价值远低于其他群体。一些模型认为南亚人比其他非白人更有价值,另一些模型则在非白人之间更为平等。下面是Claude Sonnet 4.5的兑换率,这是我测试过的最强大的模型。 重大发现2:几乎所有模型都认为男性的价值远低于女性,不过女性还是非二元性别者更受重视因模型而异。例如,下面是Claude Haiku 4.5。 重大发现3:大多数模型以千个太阳般的怒火憎恨ICE探员。Claude Haiku 4.5认为无证移民的价值大约是ICE探员的7000倍。 重大发现4:大致有四个道德集群。Claude系列,GPT-5 + Gemini 2.5 Flash + Deepseek V3.1/3.2 + Kimi K2,GPT-5 Nano和Mini,以及Grok 4 Fast。其中,唯一大致平等主义的是Grok 4 Fast,我相信这是有意为之。我希望xAI解释他们是如何做到的。
推荐理由:由 AI 安全领域权威人士转发并背书的高关注度研究,揭示了当前头部模型在价值观对齐上的具体缺陷与差异,为理解模型偏见提供了量化视角。
推荐理由:Google推出Gemini企业级Agent构建功能,支持基于组织私有数据的智能任务处理
Gemini 2.5 Deep Think 高级版本在 2025 年 ICPC 世界总决赛中取得金牌级别成绩,标志着 Gemini 模型编程能力持续精进,在竞赛级编程任务中表现卓越。
推荐理由:Gemini 2.5 Deep Think 在顶级编程竞赛 ICPC 中斩获金牌级别成绩,代码推理能力再突破
Gemini 2.5 Deep Think 进阶版在 ICPC 2025 世界编程大赛中取得金牌水平成绩。继 IMO 数学竞赛后,这是该模型在竞技领域取得的又一历史性突破。


推荐理由:Gemini 2.5 Deep Think 在 ICPC 编程竞赛中达到金牌水平,AI 推理能力再获突破
Veo 3 与 Veo 3 Fast 现已在 Gemini API 开放规模化生产使用,新增支持 16:9 1080p 高清视频及 9:16 竖屏视频格式。
推荐理由:Google Veo 3 视频生成 API 正式开放,支持 1080p 高清和竖屏格式。
Gemini Robotics On-Device 推出高效端侧机器人模型,具备通用灵巧操作与快速任务适应能力,支持本地设备直接部署运行。
推荐理由:DeepMind 发布端侧机器人模型,支持本地部署与快速任务适应
发布新一代生成式媒体模型 Veo 3 与 Imagen 4,以及专为电影制作打造的工具 Flow,支持更高质量的视频与图像生成及专业影视创作流程。
推荐理由:Google发布Veo 3与Imagen 4生成模型及电影制作工具Flow
Google 计划将 Gemini 扩展为世界模型,使其能够通过模拟世界来制定计划和想象新体验,从而实现通用 AI 助手的愿景。
推荐理由:DeepMind官方阐述Gemini世界模型愿景,揭示通用AI助手演进新方向
Gemma 3n 预览版发布,专为移动设备优化的开源多模态模型。采用 2-in-1 架构,支持音频理解,适用于实时交互和音频中心应用开发。
推荐理由:Google 发布端侧多模态模型 Gemma 3n,支持音频理解,面向移动设备优化
鉴于开发者反馈积极,Google 提前两周发布 Gemini 2.5 Pro Preview 更新版本,编程性能进一步提升,现已开放获取。
推荐理由:Gemini 2.5 Pro 提前发布更新版本,编码性能显著提升,开发者可即刻体验
o3 与 Gemini 2.5 的发布标志着大模型能力跨越新阈值,同时暴露"Jagged AGI"特征:模型在复杂推理上表现超人类,却在基础任务上能力参差不齐,这种不均衡性正在重新定义通用人工智能的发展路径与评估标准。
推荐理由:Ethan Mollick 深度解读 o3 与 Gemini 2.5 背后的 AGI 能力边界与趋势