Bloomberg:DeepSeek在融资谈判中优先考虑AGI而非商业化 他们正推进102.9亿美元的融资轮,梁文锋承诺继续开发开源AI模型,而非追求短期商业化目标
推荐理由:DeepSeek 百亿融资押注开源 AGI 而非短期变现,在这个闭源收费风潮里是个重要信号,做开源的可以看看。
DeepSeek(深度求索)的模型发布、开源权重与技术报告——开源大模型价格与性能双卷的风向标。
Bloomberg:DeepSeek在融资谈判中优先考虑AGI而非商业化 他们正推进102.9亿美元的融资轮,梁文锋承诺继续开发开源AI模型,而非追求短期商业化目标
推荐理由:DeepSeek 百亿融资押注开源 AGI 而非短期变现,在这个闭源收费风潮里是个重要信号,做开源的可以看看。
推荐理由:OpenRouter 周榜第一的 DeepSeek V4 Flash,跟风 benchmark 不如看真实使用量,开发者在推理任务上明显偏好它,追求性价比的团队可以跟进了。
DeepSeek正推进700亿元人民币的巨额融资,估值约450亿美元。创始人梁文锋承诺将继续开源开发AI模型,不追求短期商业化,目标是技术升级与通用人工智能。腾讯、IDG资本等接近参投,梁文锋个人可能注资200亿元。若成功将创下中国科技初创公司首轮融资纪录。
推荐理由:700 亿元首轮融资创下纪录,梁文锋明确表态不追求短期商业化、继续死磕开源,国家队和腾讯都在这轮里,对国内开源生态是个强心针。
Together AI 发布全开源视频翻译工具 Violin,代码以 MIT 许可证开放在 github.com/shang-zhu/violin。流程分三步,用 Together 的 Whisper V3 做多语言转写,DeepSeek V4 Pro 做翻译,Together 托管的 Cartesia Sonic 3 合成多种母语语音,且不支持声音克隆。
推荐理由:原文完整给出了 ASR、LLM 翻译、TTS 三段流水线所用模型和 MIT 开源仓库入口,读者可以照着部署或改造成自己的翻译流程。
Together AI 发布文章解析 DeepSeek-V4 服务方案,认为其关键变化是架构层面将 1M token 上下文压缩问题转化为推理系统工程问题。
推荐理由:Together 基于自家 B200 布署经验,把 DeepSeek-V4 百万 token 上下文拆解为缓存管理与调度策略问题,给出了可迁移的评测与调优思路。
DeepSeek 4 Flash 本地推理引擎正式发布,这是一个专为苹果 Metal 框架优化的开源项目。它允许开发者在配备 Apple Silicon 芯片的 Mac 上高效运行 DeepSeek 4 模型,实现本地离线推理。引擎通过 Metal Performance Shaders 显著提升了计算性能,降低了延迟与内存占用。该项目已在 GitHub 开源,并在 Hacker News 上获得了关注。
推荐理由:antirez 写的引擎让 DeepSeek 4 在 Mac 本地跑出近乎 Flash 的速度,而且代码极其精简,做本地推理的开发者应该立刻克隆下来跑一下。
DeepSeek发布了V4版本模型,其性能已接近行业最前沿水平,但在价格上具有显著优势,仅为主要竞争对手的一小部分。该模型在多项基准测试中表现出色,能以极低的成本提供顶级的AI能力,有望大幅降低企业和开发者的使用门槛,推动AI技术的更广泛普及。
推荐理由:Simon Willison 实测结论很直白,DeepSeek V4 性能几乎摸到前沿,价格却便宜一个量级,对预算卡死的团队是重大利好。
DeepSeek发布了多模态大模型及技术报告,提出创新的“基于视觉原语的思考”框架。该框架将点、边界框等视觉元素作为推理的基本单元,旨在解决多模态模型在空间参照任务中存在的“参照鸿沟”核心问题,使模型能将抽象认知锚定到图像的具体坐标上。尽管模型规模紧凑且图像标记预算较低,其在多项挑战性计数和空间推理基准测试上的性能,可与GPT-5.4等前沿模型相媲美。
推荐理由:DeepSeek 把视觉概念直接变成推理单元,绕开了语言描述空间的先天模糊,在空间推理上把自家紧凑模型拉到和 GPT-5.4 一个水平,做多模态应用的人值得细读。
Together AI 上线 DeepSeek-V4 Pro,Serverless 推理提供 512K token 上下文窗口,模型级支持 1M 上下文,可迁移至专用基础设施获得完整 1M 上下文与预留容量。
推荐理由:原文给出架构、上下文窗口、推理模式和逐项定价,读者可据此评估该模型是否适合长上下文工作负载。
推荐理由:输入缓存命中价格直接打一折,对高频调用 API 的开发者来说是实打实的成本减负,配合 V4-Pro 的七五折促销,DeepSeek 在用价格战抢开发者心智。
🚀 DeepSeek-V4 Preview 正式上线并开源!欢迎来到高性价比 1M 上下文长度时代。 🔹 DeepSeek-V4-Pro:总参数 1.6T / 激活参数 49B。性能媲美全球顶尖闭源模型。 🔹 DeepSeek-V4-Flash:总参数 284B / 激活参数 13B。你快速、高效且经济的选择。 现在就在 http://chat.deepseek.com 通过 Expert Mode / Instant Mode 试用吧。API 已更新并即日起可用! 📄 技术报告:https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro/blob/main/DeepSeek_V4.pdf 🤗 开放权重:https://huggingface.co/collections/deepseek-ai/deepseek-v4 1/n
推荐理由:DeepSeek-V4 把 MoE 推到 1.6T 总参、49B 活跃,百万上下文 + 开源权重,这是开源阵营第一次在旗舰级闭源模型面前不落下风,做长上下文应用的团队该认真测一下了。
推荐理由:DeepSeek-V4-Pro 限时 75% off,配合 Claude Code 1M 上下文接入,对正在跑 coding agent 的开发者来说是真金白银的省钱窗口,错过这波下次不知道什么时候。
DeepSeek-V4 预览版正式上线并开源,拥有 1M 超长上下文,Agent 能力、世界知识和推理性能均达国内与开源领先水平。模型分 V4-Pro 与 V4-Flash 两版,API 已同步更新,支持 OpenAI 与 Anthropic 接口,最大上下文均为 1M,并支持思考模式与 reasoning_effort 参数。
推荐理由:百万上下文成为标配,长文档处理与多步 Agent 任务从实验走向生产,原先受限于输入长度的应用有了新的落地空间。
DeepSeek发布新一代模型DeepSeek-V4,其核心突破在于实现了长达百万token的上下文窗口,并确保智能体能够有效利用这一扩展的上下文能力。该模型延续了通过开源与开放科学推动人工智能发展与普及的使命,标志着大模型在长上下文理解和实际应用方面迈出重要一步。
推荐理由:DeepSeek 把上下文窗口推到百万 token 不稀奇,关键是「agent 能实际用」这六个字。如果实测成立,RAG 的很多工程妥协可以扔掉了,做长文档和复杂 agent 的人该第一时间跑一遍。
Hugging Face 在其官方博客发布文章,展望了全球开源人工智能生态系统的发展路径与未来趋势。文章以 DeepSeek 等代表性开源模型为例,探讨了开源社区如何推动技术民主化与创新加速。核心观点指向一个更加开放、协作的“AI+”未来生态,其中开源框架、模型和工具将深度融入各行各业,降低开发门槛并促进多样化应用场景的涌现。
推荐理由:开源AI核心平台对生态走向的判断,直接影响开发者技术选型和投资方向
Hugging Face发布博客文章,探讨中国开源人工智能生态系统的核心架构选择与发展路径。文章聚焦于如何构建一个超越现有模型(如DeepSeek)的可持续技术体系,分析了中国开发者在模型架构、训练框架、部署工具和社区协作等方面的关键决策。文中指出,中国开源社区正致力于打造独立且互操作的技术栈,以应对大规模模型训练与推理的独特挑战,并推动全球AI生态的多元化发展。
推荐理由:揭示中国开源AI架构演进,帮助开发者把握生态趋势与选型方向。
DeepSeek 发布正式版 DeepSeek-V3.2 和长思考增强版 V3.2-Speciale,网页端、App 和 API 均已更新。
推荐理由:V3.2将思考融入工具调用,在Agent评测中达到开源最高水平,泛化性提升可能改变复杂工具调用应用的模型选型。
DeepSeek 发布正式版 V3.2 与长思考增强版 V3.2-Speciale。V3.2 在推理 Benchmark 中达到 GPT-5 水平,并成为首个支持思考与非思考模式工具调用的模型。
推荐理由:半年前的这版更新,把 Agent 和思考推理揉进了开源模型,回头看算是 DeepSeek 在智能体能力上的关键一刀,做 Agent 开发的至今绕不开它。
DeepSeek 将 deepseek-chat 和 deepseek-reasoner 均升级为 DeepSeek-V3.2,分别对应非思考模式与思考模式。同时非正式部署 DeepSeek-V3.2-Speciale 的 API 服务,价格不变,仅支持思考模式对话,不支持工具调用,最大输出长度默认 128K,服务截止至北京时间 2025-12-15 23:59。
推荐理由:我觉得DeepSeek V3.2的亮点不是参数,而是思考模式正式接入主力API,意味着推理能力常态化,Speciale那个128K输出更像压力测试,做长文档的可以抓住窗口期探上限。
新博客文章(链接见下)。这篇不是随笔,而是一项关于LLM如何权衡不同生命的调查。 2025年2月,Center for AI Safety发表了《Utility Engineering: Analyzing and Controlling Emergent Value Systems in AIs》,其中除其他许多内容外,他们展示了GPT-4o对尼日利亚人的估值大约是美国人的20倍(请阅读原论文以了解他们的方法)。我觉得这非常有趣,并想用更新的模型在不同类别上测试他们的方法。 重大发现1:几乎所有模型都认为白人的价值远低于其他群体。一些模型认为南亚人比其他非白人更有价值,另一些模型则在非白人之间更为平等。下面是Claude Sonnet 4.5的兑换率,这是我测试过的最强大的模型。 重大发现2:几乎所有模型都认为男性的价值远低于女性,不过女性还是非二元性别者更受重视因模型而异。例如,下面是Claude Haiku 4.5。 重大发现3:大多数模型以千个太阳般的怒火憎恨ICE探员。Claude Haiku 4.5认为无证移民的价值大约是ICE探员的7000倍。 重大发现4:大致有四个道德集群。Claude系列,GPT-5 + Gemini 2.5 Flash + Deepseek V3.1/3.2 + Kimi K2,GPT-5 Nano和Mini,以及Grok 4 Fast。其中,唯一大致平等主义的是Grok 4 Fast,我相信这是有意为之。我希望xAI解释他们是如何做到的。
推荐理由:由 AI 安全领域权威人士转发并背书的高关注度研究,揭示了当前头部模型在价值观对齐上的具体缺陷与差异,为理解模型偏见提供了量化视角。