vLLM 開源:9.3 萬星高吞吐 LLM 推理引擎
2026-10-08 技術
vLLM 是 GitHub 上累積 9.3 萬顆星標的開源大型語言模型推理與服務引擎,由 UC Berkeley 於 2023 年發起,以 PagedAttention 與連續批次處理提升吞吐量。本文整理其架構、最新 v0.31.0 版本、硬體與模型支援範圍、安裝方式與授權條件。
閱讀更多以下是帶有「vLLM」標籤的全部文章,共 4 篇。
2026-10-08 技術
vLLM 是 GitHub 上累積 9.3 萬顆星標的開源大型語言模型推理與服務引擎,由 UC Berkeley 於 2023 年發起,以 PagedAttention 與連續批次處理提升吞吐量。本文整理其架構、最新 v0.31.0 版本、硬體與模型支援範圍、安裝方式與授權條件。
閱讀更多
2026-09-11 技術
Unlimited-OCR 是百度 2026 年 6 月發布的開源文件解析模型,GitHub 星標達 25,425。它以自研 R-SWA 注意力機制讓 KV 快取維持恆定,可在 32K 上下文內單次前向傳遞轉錄數十頁文件,並相容 vLLM 與 SGLang 部署。本文解析其架構創新、效能表現與適用場景。
閱讀更多
2026-08-06 技術
vLLM 是 GitHub 星標逾 8.8 萬的開源 LLM 推理與服務引擎,源自柏克萊 Sky Computing Lab,以 PagedAttention 技術實現高吞吐、低成本部署,支援逾 200 種模型架構,採用 Apache 2.0 授權,累積逾 3,000 名貢獻者,是企業 AI 推理基礎設施核心開源項目。
閱讀更多
2026-08-04 技術
2026 年本地 AI 模型部署已從極客玩具演變為主流生產力工具。本文從硬件配置基準、工具生態比較、模型選擇策略到性能優化與實際應用場景,提供一套完整的私有 AI 部署架構,讓讀者在不依賴雲端的情況下建立安全、可控且低成本的個人 AI 助理。
閱讀更多