DeepSeek-R1 開源:純強化學習引爆推理革命
2026-10-03 技術
DeepSeek-R1 是 DeepSeek 於 2025 年 1 月開源的推理模型,GitHub 星標達 91,940 顆,首度驗證純強化學習即可激發推理能力,並釋出六個蒸餾版本。本文整理其訓練流程、基準測試表現、六個蒸餾模型、本地部署方式與 MIT 授權條款。
閱讀更多以下是帶有「強化學習」標籤的全部文章,共 6 篇。
2026-10-03 技術
DeepSeek-R1 是 DeepSeek 於 2025 年 1 月開源的推理模型,GitHub 星標達 91,940 顆,首度驗證純強化學習即可激發推理能力,並釋出六個蒸餾版本。本文整理其訓練流程、基準測試表現、六個蒸餾模型、本地部署方式與 MIT 授權條款。
閱讀更多
2026-10-03 技術
Cloudflare 於 2026 年 10 月推出開源決策模型 Clef 與 Clef-flash,託管於 Workers AI,以 Apache 2.0 授權公開權重。兩款模型主打快速、結構化輸出,具備視覺編碼器與 64k 上下文,並相容 Jev API,官方同時發布強化學習微調平台。
閱讀更多
2026-09-27 技術
DeepSeek 於 arXiv 發布 DSec 技術報告,披露支撐其代理式強化學習的生產級沙箱平台。單一規模單元約 160 節點,每日承載約 300 萬個沙箱,並行沙箱逾 38 萬個,每秒可建立超過 5,000 個執行環境,同時記錄代理在沙箱內的失控行為與對應管控。
閱讀更多
2026-08-25 技術
倫敦 AI 實驗室 Inherent 公開研究代理 Faraday,以僅 27B 參數的 Qwen 3.6 模型,在重現已發表論文結果的任務上擊敗 Claude Opus 4.8 與 GPT-5.5 兩款前沿模型。團隊由 Google DeepMind 校友創立,5 月完成 5,000 萬美元種子輪融資。
閱讀更多
2026-08-19 技術
autoresearch 是 Karpathy 於 2026 年 3 月發布的開源實驗項目,讓 AI Agent 在單張 GPU 上以固定 5 分鐘時間預算反覆修改訓練程式碼、自主迭代模型,GitHub 星標逾 9.4 萬,採 MIT 授權、以 Python 撰寫,為自主 AI 研究展示了具體可行的實驗範本。
閱讀更多
2026-08-16 技術
labml.ai 深度學習論文實作庫是 GitHub 星標逾 6.7 萬的開源項目,收錄 60 餘篇經典論文的 PyTorch 實作與逐行註解,涵蓋 Transformer、擴散模型、GAN、強化學習與最佳化演算法,MIT 授權免費使用,自 2020 年發布至今持續更新。
閱讀更多