標籤:強化學習

以下是帶有「強化學習」標籤的全部文章,共 6 篇。

DeepSeek-R1 開源:純強化學習引爆推理革命

DeepSeek-R1 開源:純強化學習引爆推理革命

2026-10-03 技術

DeepSeek-R1 是 DeepSeek 於 2025 年 1 月開源的推理模型,GitHub 星標達 91,940 顆,首度驗證純強化學習即可激發推理能力,並釋出六個蒸餾版本。本文整理其訓練流程、基準測試表現、六個蒸餾模型、本地部署方式與 MIT 授權條款。

閱讀更多
DeepSeek 發布 DSec:代理訓練沙箱基建

DeepSeek 發布 DSec:代理訓練沙箱基建

2026-09-27 技術

DeepSeek 於 arXiv 發布 DSec 技術報告,披露支撐其代理式強化學習的生產級沙箱平台。單一規模單元約 160 節點,每日承載約 300 萬個沙箱,並行沙箱逾 38 萬個,每秒可建立超過 5,000 個執行環境,同時記錄代理在沙箱內的失控行為與對應管控。

閱讀更多
94,077 星開源項目:Karpathy 的 autoresearch — 自主研究

94,077 星開源項目:Karpathy 的 autoresearch — 自主研究

2026-08-19 技術

autoresearch 是 Karpathy 於 2026 年 3 月發布的開源實驗項目,讓 AI Agent 在單張 GPU 上以固定 5 分鐘時間預算反覆修改訓練程式碼、自主迭代模型,GitHub 星標逾 9.4 萬,採 MIT 授權、以 Python 撰寫,為自主 AI 研究展示了具體可行的實驗範本。

閱讀更多

← 返回全部標籤

Eric Chan 的頭像
Eric Chan

IT 顧問・實測主義者

IT 行業 18 年。分享親身實測過的 UI、前端、AI 工具與科技心得。實測之後才分享,不靠 Copy-and-Paste。

了解更多
文章分類