DeepSeek-V3.2 技术报告解读:稀疏注意力与专家蒸馏 Posted on 2026-08-04 | In 大模型全栈知识 , 模型认知与生态 | 1.2k | 5 分钟DeepSeek-V3.2 在 V3.1-Terminus 的 128K 上下文 checkpoint 上继续预训练,核心是引入 DeepSeek 稀疏注意力(DSA):用轻量索引器为每个 query token 挑选关键上下文。本文梳理其预训练与后训练配方、专家蒸馏与基础设施设计。Read more »
开源大模型技术演进时间线:预训练、后训练与强化学习 Posted on 2026-08-04 | In 大模型全栈知识 , 模型认知与生态 | 3.3k | 14 分钟基于 36 篇技术报告梳理 2025 下半年到 2026 上半年的开源大模型技术演进:注意力从全局走向混合稀疏、DSA 成为事实标杆、线性注意力在旗舰模型落地、滑动窗口回归与 Mamba 路线,以及 MoE、训练精度与 MTP 的演进趋势。Read more »
Seed2.0 Model Card 解读:面向真实世界复杂性的三档模型 Posted on 2026-08-04 | In 大模型全栈知识 , 模型认知与生态 | 500 | 2 分钟梳理字节跳动 Seed2.0 的 Model Card 内容:面向不同延迟场景的 Pro、Lite、Mini 三档规模划分、设计优先级与评测重点,并说明该报告以能力展示与部署模式为主、未披露训练配方这一性质。Read more »
Seed1.5-VL 技术报告解读:原生分辨率视觉与混合可验证奖励强化学习 Posted on 2026-08-04 | In 大模型全栈知识 , 模型认知与生态 | 688 | 2 分钟解读字节跳动 Seed1.5-VL:原生动态分辨率的 SeedViT 视觉编码器、只监督最终输出而不约束思维链的监督策略,以及联合 RLHF 与 RLVF 并用视觉语言模型自身充当奖励模型的混合强化学习方案。Read more »
Seed1.5-Thinking 技术报告解读:VAPO 与 DAPO 强化学习训练推理模型 Posted on 2026-08-04 | In 大模型全栈知识 , 模型认知与生态 | 666 | 2 分钟解读字节跳动 Seed1.5-Thinking 的强化学习方案:VAPO 与 DAPO 两类算法提升推理模型的训练稳定性、带推理路径的验证器把准确率推到 99.3% 以消除奖励作弊,以及 Decoupled-GAE 与长度自适应优化。Read more »
Qwen3 技术报告解读:三阶段预训练与思考模式统一 Posted on 2026-08-04 | In 大模型全栈知识 , 模型认知与生态 | 1.3k | 5 分钟解读 Qwen3 的技术报告:通用、质量提升与长上下文三阶段预训练共约 36T token 的数据配比与学习率策略,以及长思维链冷启动、推理强化学习、思考模式融合与通用强化学习组成的四阶段后训练管线。Read more »
Qwen3.5 技术报告解读:397B 稀疏 MoE 与原生多模态融合 Posted on 2026-08-04 | In 大模型全栈知识 , 模型认知与生态 | 729 | 2 分钟梳理 Qwen3.5 旗舰模型 397B-A17B 的关键设计:线性注意力 GDN 替代 75% 标准注意力让 256K 上下文效率提升 19 倍、从预训练第一步就统一视觉语言的 Early Fusion、仅激活 4.3% 参数的极端稀疏 MoE,以及覆盖 201 种语言的 250K 词表。Read more »
Qwen3.5-Omni 技术报告解读:ARIA 单流生成与在线策略蒸馏 Posted on 2026-08-04 | In 大模型全栈知识 , 模型认知与生态 | 937 | 3 分钟解读 Qwen3.5-Omni 的全模态架构:Thinker 与 Talker 均采用混合 MoE 加 GDN 提升长音视频推理效率、用 ARIA 统一文本与语音交错的单流生成以消除双轨同步开销,并通过在线策略蒸馏缩小语音回复的质量差距。Read more »
Qwen3-VL 技术报告解读:交错 MRoPE 与 DeepStack 视觉特征融合 Posted on 2026-08-04 | In 大模型全栈知识 , 模型认知与生态 | 1.2k | 4 分钟解读 Qwen3-VL 的四阶段预训练设计与三项关键创新:交错式多模态 RoPE、把视觉特征分层注入语言模型的 DeepStack、以文本形式表达视频时间戳,以及平衡多模态 token 损失的平方根重加权策略。Read more »
Qwen2.5-VL 技术报告解读:原生动态分辨率 ViT 与绝对时间编码 Posted on 2026-08-04 | In 大模型全栈知识 , 模型认知与生态 | 914 | 3 分钟解读 Qwen2.5-VL 的关键设计:支持任意分辨率输入的原生动态分辨率 ViT 配合窗口注意力大幅降低计算开销、对齐绝对时间而非归一化位置的多模态 RoPE 实现秒级事件定位,以及 SFT 加 DPO 的后训练流程。Read more »
Qwen2.5-Omni 技术报告解读:时间对齐多模态 RoPE 与流式语音生成 Posted on 2026-08-04 | In 大模型全栈知识 , 模型认知与生态 | 935 | 3 分钟解读 Qwen2.5-Omni 的全模态设计:用时间对齐多模态 RoPE 同步音视频时间戳、音频编码器改为分块注意力、视觉编码器引入 Flash Attention 与 token 合并,并通过滑窗 DiT 实现流式语音生成。Read more »
Phi-4-Reasoning 技术报告解读:可教学数据过滤与推理能力训练 Posted on 2026-08-04 | In 大模型全栈知识 , 模型认知与生态 | 760 | 3 分钟解读微软 Phi-4-reasoning 的数据工程:从公开网站、已有数据集与合成问题收集种子题库,再按问题是否处于可教学难度区间筛选样本,并梳理其监督微调与强化学习两阶段后训练方案。Read more »