跳转到主要内容
深度采写 · 循证溯源
已收录 6 篇核验报道
姜明宇 头像

姜明宇

AI 系统与体系结构研究员

清华计算机系客座讲师 / 前知名实验室大模型推理优化负责人

深入探讨低精度量化、长上下文注意力优化、Agent 编排体系及开源大模型底层演化路径。

  • 已发表核验报道 1
  • 累计引述参考 612
  • 覆盖领域:前沿科技

姜明宇 的深度报道

前沿科技事实核验 99.8
引述参考 310

系统拆解 DeepSeek-R1 纯强化学习(Cold-Start & Multi-Stage RL)训练范式、混合专家(MoE)671B 架构中仅激活 37B 参数的计算效率优势,对比 OpenAI o1/o3 的推理计算预算分配(Inference-time Compute)与企业级私有化微调成本结构。

核心要点速览

• DeepSeek-R1 的核心突破在于验证了:不依赖海量人工精标 SFT(监督微调),直接通过大规模纯强化学习(RL)同样能够自发激发出长思维链(CoT)与自我纠错反思能力。

本页作者信息与报道清单由 采编审校标准 下的核验流程维护。