Grok-1 全面開源:314B 參數 MoE 權重釋出
2026-09-03 技術
xAI 開源 314B 參數 MoE 模型 Grok-1 的完整權重,採 Apache 2.0 授權,GitHub 逾 5.2 萬星,是大廠開放權重的標誌性事件。本文分析其模型規格、JAX 推理架構與開源生態影響,並提供下載指引,適合關注自托管 LLM 與開源 AI 策略的開發者。
閱讀更多以下是帶有「MoE」標籤的全部文章,共 4 篇。
2026-09-03 技術
xAI 開源 314B 參數 MoE 模型 Grok-1 的完整權重,採 Apache 2.0 授權,GitHub 逾 5.2 萬星,是大廠開放權重的標誌性事件。本文分析其模型規格、JAX 推理架構與開源生態影響,並提供下載指引,適合關注自托管 LLM 與開源 AI 策略的開發者。
閱讀更多
2026-09-02 技術
阿里巴巴 Qwen 團隊開源 Qwen3 系列大語言模型,涵蓋 0.6B 至 235B-A22B 多種規模,支援思考與非思考模式切換、256K 長上下文擴展至 100 萬 tokens,並以 Apache 2.0 授權釋出。本文分析其架構創新、生態支援與部署路徑,值得開發者留意。
閱讀更多
2026-08-26 技術
智譜 AI 今日突襲發佈 GLM-5.3-Flash:GLM-5 系列首個原生多模態模型,320B 總參數、僅 18B 活躍參數,效能超越 GLM-5.2 之餘價格只需十分之一,編程與 Agent 能力逼近 Claude Opus 4.8。本文拆解其混合注意力架構、30T 多模態預訓練、開源授權與本地部署方案。
閱讀更多
2026-08-09 技術
DeepSeek-V3 是深度求索發佈的開源 MoE 大語言模型,總參數 671B、單次推理僅啟動 37B,GitHub 星標逾 10.4 萬。其 FP8 混合精度訓練與多 Token 預測等創新,令訓練成本降至 278.8 萬 H800 GPU 小時,基準測試表現媲美 GPT-4o 等閉源旗艦。
閱讀更多