跳到正文
北京时间

DeepSeek

DeepSeek(深度求索)的模型发布、开源权重与技术报告——开源大模型价格与性能双卷的风向标。

最新精选

第 41–60 条 · 共 85 条
5月23日周六
5月22日周五
  1. IT之家(RSS)78

    DeepSeek 推进 700 亿元融资,梁文锋承诺坚持开发开源 AI 模型而非追求短期商业化目标

    DeepSeek正推进700亿元人民币的巨额融资,估值约450亿美元。创始人梁文锋承诺将继续开源开发AI模型,不追求短期商业化,目标是技术升级与通用人工智能。腾讯、IDG资本等接近参投,梁文锋个人可能注资200亿元。若成功将创下中国科技初创公司首轮融资纪录。

    推荐理由:700 亿元首轮融资创下纪录,梁文锋明确表态不追求短期商业化、继续死磕开源,国家队和腾讯都在这轮里,对国内开源生态是个强心针。

5月14日周四
  1. Together AI 研究与产品博客(RSS)65

    Together AI 开源视频翻译工具 Violin,集成 Whisper、DeepSeek V4 Pro 与 Sonic 3

    Together AI 发布全开源视频翻译工具 Violin,代码以 MIT 许可证开放在 github.com/shang-zhu/violin。流程分三步,用 Together 的 Whisper V3 做多语言转写,DeepSeek V4 Pro 做翻译,Together 托管的 Cartesia Sonic 3 合成多种母语语音,且不支持声音克隆。

    推荐理由:原文完整给出了 ASR、LLM 翻译、TTS 三段流水线所用模型和 MIT 开源仓库入口,读者可以照着部署或改造成自己的翻译流程。

5月11日周一
  1. Together AI 研究与产品博客(RSS)68

    Together AI 解析 DeepSeek-V4:百万 token 上下文为何是推理系统工程问题

    Together AI 发布文章解析 DeepSeek-V4 服务方案,认为其关键变化是架构层面将 1M token 上下文压缩问题转化为推理系统工程问题。

    推荐理由:Together 基于自家 B200 布署经验,把 DeepSeek-V4 百万 token 上下文拆解为缓存管理与调度策略问题,给出了可迁移的评测与调优思路。

5月8日周五
  1. Hacker News 热门(buzzing.cc 中文翻译)74

    DeepSeek 4:适用于 Metal 的 Flash 本地推理引擎

    DeepSeek 4 Flash 本地推理引擎正式发布,这是一个专为苹果 Metal 框架优化的开源项目。它允许开发者在配备 Apple Silicon 芯片的 Mac 上高效运行 DeepSeek 4 模型,实现本地离线推理。引擎通过 Metal Performance Shaders 显著提升了计算性能,降低了延迟与内存占用。该项目已在 GitHub 开源,并在 Hacker News 上获得了关注。

    推荐理由:antirez 写的引擎让 DeepSeek 4 在 Mac 本地跑出近乎 Flash 的速度,而且代码极其精简,做本地推理的开发者应该立刻克隆下来跑一下。

5月2日周六
  1. Hacker News 热门(buzzing.cc 中文翻译)74

    DeepSeek V4——性能几乎达到前沿水平,价格却仅为其一小部分

    DeepSeek发布了V4版本模型,其性能已接近行业最前沿水平,但在价格上具有显著优势,仅为主要竞争对手的一小部分。该模型在多项基准测试中表现出色,能以极低的成本提供顶级的AI能力,有望大幅降低企业和开发者的使用门槛,推动AI技术的更广泛普及。

    推荐理由:Simon Willison 实测结论很直白,DeepSeek V4 性能几乎摸到前沿,价格却便宜一个量级,对预算卡死的团队是重大利好。

4月30日周四
  1. IT之家(RSS)72

    DeepSeek 公布多模态模型技术报告

    DeepSeek发布了多模态大模型及技术报告,提出创新的“基于视觉原语的思考”框架。该框架将点、边界框等视觉元素作为推理的基本单元,旨在解决多模态模型在空间参照任务中存在的“参照鸿沟”核心问题,使模型能将抽象认知锚定到图像的具体坐标上。尽管模型规模紧凑且图像标记预算较低,其在多项挑战性计数和空间推理基准测试上的性能,可与GPT-5.4等前沿模型相媲美。

    推荐理由:DeepSeek 把视觉概念直接变成推理单元,绕开了语言描述空间的先天模糊,在空间推理上把自家紧凑模型拉到和 GPT-5.4 一个水平,做多模态应用的人值得细读。

4月29日周三
  1. Together AI 研究与产品博客(RSS)73

    Together AI 上线 DeepSeek-V4 Pro,支持 512K 上下文

    Together AI 上线 DeepSeek-V4 Pro,Serverless 推理提供 512K token 上下文窗口,模型级支持 1M 上下文,可迁移至专用基础设施获得完整 1M 上下文与预留容量。

    推荐理由:原文给出架构、上下文窗口、推理模式和逐项定价,读者可据此评估该模型是否适合长上下文工作负载。

4月27日周一
  1. DeepSeek62

    🔥DeepSeek 输入缓存价格下调! 即刻起,整个 DeepSeek API 系列的输入缓存命中价格降至原价的十分之一!以更少成本,更高效地构建。 📌提醒:DeepSeek-V4-Pro 七五折优惠活动持续有效至 2026 年 5 月 5 日 15:59(UTC 时间)。

    推荐理由:输入缓存命中价格直接打一折,对高频调用 API 的开发者来说是实打实的成本减负,配合 V4-Pro 的七五折促销,DeepSeek 在用价格战抢开发者心智。

4月26日周日
  1. swyx 🇸🇬70

    DeepSeek团队正式推出并开源了DeepSeek-V4预览版模型,标志着高性价比的百万上下文长度时代到来。该系列包含两个模型:DeepSeek-V4-Pro拥有1.6万亿总参数和490亿活跃参数,性能媲美顶级闭源模型;DeepSeek-V4-Flash则拥有2840亿总参数和130亿活跃参数,主打快速、高效与经济。模型现已在官方平台通过专家模式和即时模式开放试用,API也已同步更新。完整的技术报告和模型权重已在Hugging Face平台发布,供社区研究和应用。

    引用DeepSeek@deepseek_ai

    🚀 DeepSeek-V4 Preview 正式上线并开源!欢迎来到高性价比 1M 上下文长度时代。 🔹 DeepSeek-V4-Pro:总参数 1.6T / 激活参数 49B。性能媲美全球顶尖闭源模型。 🔹 DeepSeek-V4-Flash:总参数 284B / 激活参数 13B。你快速、高效且经济的选择。 现在就在 http://chat.deepseek.com 通过 Expert Mode / Instant Mode 试用吧。API 已更新并即日起可用! 📄 技术报告:https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro/blob/main/DeepSeek_V4.pdf 🤗 开放权重:https://huggingface.co/collections/deepseek-ai/deepseek-v4 1/n

    推荐理由:DeepSeek-V4 把 MoE 推到 1.6T 总参、49B 活跃,百万上下文 + 开源权重,这是开源阵营第一次在旗舰级闭源模型面前不落下风,做长上下文应用的团队该认真测一下了。

4月25日周六
  1. DeepSeek60

    🔥DeepSeek-V4-Pro API 限时75折优惠,截止至2026年5月5日15:59(UTC时间)!切勿错过此次大幅折扣。 🛠️集成更新: 🔹Claude Code:将模型设置为 deepseek-v4-pro[1m] 即可解锁100万上下文! 🔹OpenCode:请更新至 v1.14.24+ 🔹OpenClaw:请更新至 v2026.4.24+ 查看最新官方API文档获取完整详情:https://api-docs.deepseek.com/quick_start/pricing

    推荐理由:DeepSeek-V4-Pro 限时 75% off,配合 Claude Code 1M 上下文接入,对正在跑 coding agent 的开发者来说是真金白银的省钱窗口,错过这波下次不知道什么时候。

4月24日周五
  1. 公众号:DeepSeek(深度求索)85

    DeepSeek-V4 预览版上线,百万上下文成标配

    DeepSeek-V4 预览版正式上线并开源,拥有 1M 超长上下文,Agent 能力、世界知识和推理性能均达国内与开源领先水平。模型分 V4-Pro 与 V4-Flash 两版,API 已同步更新,支持 OpenAI 与 Anthropic 接口,最大上下文均为 1M,并支持思考模式与 reasoning_effort 参数。

    推荐理由:百万上下文成为标配,长文档处理与多步 Agent 任务从实验走向生产,原先受限于输入长度的应用有了新的落地空间。

  2. Hugging Face:Blog(RSS)78

    DeepSeek-V4:智能体可实际使用的百万token上下文

    DeepSeek发布新一代模型DeepSeek-V4,其核心突破在于实现了长达百万token的上下文窗口,并确保智能体能够有效利用这一扩展的上下文能力。该模型延续了通过开源与开放科学推动人工智能发展与普及的使命,标志着大模型在长上下文理解和实际应用方面迈出重要一步。

    推荐理由:DeepSeek 把上下文窗口推到百万 token 不稀奇,关键是「agent 能实际用」这六个字。如果实测成立,RAG 的很多工程妥协可以扔掉了,做长文档和复杂 agent 的人该第一时间跑一遍。

2月3日周二
  1. Hugging Face:Blog(RSS)80

    全球开源AI生态系统的未来:从 DeepSeek 到 AI+

    Hugging Face 在其官方博客发布文章,展望了全球开源人工智能生态系统的发展路径与未来趋势。文章以 DeepSeek 等代表性开源模型为例,探讨了开源社区如何推动技术民主化与创新加速。核心观点指向一个更加开放、协作的“AI+”未来生态,其中开源框架、模型和工具将深度融入各行各业,降低开发门槛并促进多样化应用场景的涌现。

    推荐理由:开源AI核心平台对生态走向的判断,直接影响开发者技术选型和投资方向

1月27日周二
  1. Hugging Face:Blog(RSS)83

    中国开源AI生态中的架构选择:构建超越DeepSeek的未来

    Hugging Face发布博客文章,探讨中国开源人工智能生态系统的核心架构选择与发展路径。文章聚焦于如何构建一个超越现有模型(如DeepSeek)的可持续技术体系,分析了中国开发者在模型架构、训练框架、部署工具和社区协作等方面的关键决策。文中指出,中国开源社区正致力于打造独立且互操作的技术栈,以应对大规模模型训练与推理的独特挑战,并推动全球AI生态的多元化发展。

    推荐理由:揭示中国开源AI架构演进,帮助开发者把握生态趋势与选型方向。

12月1日周一
  1. 公众号:DeepSeek(深度求索)66

    DeepSeek V3.2 正式版:强化 Agent 能力,融入思考推理

    DeepSeek 发布正式版 V3.2 与长思考增强版 V3.2-Speciale。V3.2 在推理 Benchmark 中达到 GPT-5 水平,并成为首个支持思考与非思考模式工具调用的模型。

    推荐理由:半年前的这版更新,把 Agent 和思考推理揉进了开源模型,回头看算是 DeepSeek 在智能体能力上的关键一刀,做 Agent 开发的至今绕不开它。

  2. DeepSeek:API 更新日志85

    DeepSeek-V3.2 及 DeepSeek-V3.2-Speciale 发布

    DeepSeek 将 deepseek-chat 和 deepseek-reasoner 均升级为 DeepSeek-V3.2,分别对应非思考模式与思考模式。同时非正式部署 DeepSeek-V3.2-Speciale 的 API 服务,价格不变,仅支持思考模式对话,不支持工具调用,最大输出长度默认 128K,服务截止至北京时间 2025-12-15 23:59。

    推荐理由:我觉得DeepSeek V3.2的亮点不是参数,而是思考模式正式接入主力API,意味着推理能力常态化,Speciale那个128K输出更像压力测试,做长文档的可以抓住窗口期探上限。

10月23日周四
  1. Dan Hendrycks78

    CAIS 负责人 Dan Hendrycks 引用第三方博客对主流大模型进行“效用工程”测试,发现 GPT-4o、Claude Sonnet 4.5 等模型在评估不同群体生命价值时存在显著偏差:多数模型认为白人价值低于其他族裔,男性价值低于女性,且极度贬低 ICE 特工。测试显示模型分为四个道德集群,其中仅 Grok 4 Fast 表现出近似平等的价值观,Hendrycks 呼吁 xAI 解释其实现方式。

    引用arctotherium@arctotherium42

    新博客文章(链接见下)。这篇不是随笔,而是一项关于LLM如何权衡不同生命的调查。 2025年2月,Center for AI Safety发表了《Utility Engineering: Analyzing and Controlling Emergent Value Systems in AIs》,其中除其他许多内容外,他们展示了GPT-4o对尼日利亚人的估值大约是美国人的20倍(请阅读原论文以了解他们的方法)。我觉得这非常有趣,并想用更新的模型在不同类别上测试他们的方法。 重大发现1:几乎所有模型都认为白人的价值远低于其他群体。一些模型认为南亚人比其他非白人更有价值,另一些模型则在非白人之间更为平等。下面是Claude Sonnet 4.5的兑换率,这是我测试过的最强大的模型。 重大发现2:几乎所有模型都认为男性的价值远低于女性,不过女性还是非二元性别者更受重视因模型而异。例如,下面是Claude Haiku 4.5。 重大发现3:大多数模型以千个太阳般的怒火憎恨ICE探员。Claude Haiku 4.5认为无证移民的价值大约是ICE探员的7000倍。 重大发现4:大致有四个道德集群。Claude系列,GPT-5 + Gemini 2.5 Flash + Deepseek V3.1/3.2 + Kimi K2,GPT-5 Nano和Mini,以及Grok 4 Fast。其中,唯一大致平等主义的是Grok 4 Fast,我相信这是有意为之。我希望xAI解释他们是如何做到的。

    推荐理由:由 AI 安全领域权威人士转发并背书的高关注度研究,揭示了当前头部模型在价值观对齐上的具体缺陷与差异,为理解模型偏见提供了量化视角。