把 LLM 跑起來,真的只是把模型下載下來就好了嗎?答案是:還沒。GPU 資源怎麼配、推論引擎怎麼選、模型怎麼保存,甚至 Hugging Face 的模型授權與 Token 都可能成為部署時的關卡。

數位無限的 AI-Stack 平台,協助企業統一調度 GPU 算力與管理 AI 基礎設施; 其中的快速容器服務 (RCS) 功能,讓使用者無需重建環境,即可快速部署模型與應用服務。 

本篇文章,我們就一步步示範給大家看,如何在 AI-Stack 上使用 RCS 功能搭配 vLLM 部署 google/gemma-3-1b-it 語言模型!另外,也會實際示範遇到 Hugging Face 受限模型 (Gated model) 時,該如何完成授權與 Token 設定。

動手實作:用 RCS 部署 vLLM,讓 Gemma-3-1B 跑起來 

管理者平台設定儲存叢集

首先,為避免每次部署時重複下載模型,我們需要配置一個儲存叢集用來存放模型 檔案。登入 AI-Stack 管理者平台,進入[設定] > [儲存叢集] > [儲存叢集 管理] 頁面,新增一個儲存叢集。 

儲存叢集建立好後,確認狀態顯示為 「啟用」,就可以在此儲存叢集上建立儲存空間,供後續部署 vLLM 時使用。

再來,登入 AI-Stack 的使用者平台。進入左側選單的「機器學習專案」>「專案列表」,選擇要用來部署模型的專案,本範例選擇 Project 1。

建立 RCS 容器

接下來,就可以去「快速容器服務」>「部署應用程式」,設定以下內容:

  1. 「名稱」:自訂,本範例填入 demo。
  2. 「歷史版本記錄上限」:決定要留多少版本,方便日後需要時回復。
  3. 「容器集數量」:設定同時啟動幾個容器副本對外提供服務。數量越多,能承載的併發請求也越多;本次為功能示範,因此設定為 1 即可。

設定完成後,點選 「新增容器」。

接著就可以新增容器了!點選 [新增容器],[名稱] 自訂,再點選 [請選擇鏡像]。

在鏡像選擇頁面中,選擇 「手動下載」,並在「鏡像路徑」填入 vLLM 的官方鏡像。本範例使用:vllm/vllm-openai:v0.26.0-cu129-ubuntu2404

選擇好鏡像後,回到新增容器的設定頁面。

接下來,設定容器的基本資源:

  1. 「規格」:依照模型大小選擇適合的 GPU 資源。可以先估算模型本身所需的 GPU 記憶體,再預留一些空間給 vLLM 運算使用。例如模型約需要 6 GB GPU 記憶體,建議選擇 8~9 GB 的 GPU 規格,保留一定的緩衝空間。
  2. 「通訊埠」:填入預設 port 號 8000。vLLM 預設會透過此 Port 提供 API 服務。

取得 Hugging Face 模型存取權限

接下來是這次部署比較特別的地方。因為 gemma-3-1b-it 是受限模型,需要先取得模型的存取權限。首先,登入 Hugging Face 帳號,開啟一個新分頁,前往你要部署的模型頁面。這邊是用 huggingface.co/google/gemma-3-1b-it,點選「Acknowledge license」完成授權。

這一步很重要,因為只有完成模型授權後,帳號才會取得該模型的存取權限。

(圖一: 網址輸入你要的模型網址)

取得模型存取權限後,需建立一組 Hugging Face Token,讓稍後建立的 vLLM 容器可以使用這組 Token 驗證身分並下載模型。進入https://huggingface.co/settings/tokens頁面,接著點選 「 Create new token 」。

建立 Token 時,主要需要設定以下兩項:

  • Token name:自訂,本範例填入 demo。
  • Token Type:如果只是讓 vLLM 下載模型,選擇 Read 即可。

設定完成後,點選 「Create Token」,系統會產生一串以 hf_ 開頭的 Token。

這裡要特別注意:Token 完整內容只會在建立時顯示這一次。所以這一步一定要立刻按旁邊的複製按鈕。

Token 複製完成後,切回 AI-Stack 的容器設定頁面,找到 「環境變數」,新增一組環境變數

  • Key:HF_TOKEN (這是 Hugging Face 的函式庫預設讀取的環境變數名稱)
  • Value:貼上剛剛複製的 hf_ 開頭 Token

掛載模型儲存空間

接著點選 「掛載」>「掛載磁碟區」。

選擇前面建立好的儲存磁碟區。在「掛載路徑」填入:/root/.cache/huggingface

將 Hugging Face 的快取目錄掛載到儲存空間後,下載好的模型就可以保存下來。之後重新建立或啟動容器時,就不需要每次都重新下載模型。

設定 vLLM 啟動指令

接下來回到新增容器頁面,找到 「執行命令」,填入:

vllm serve –model google/gemma-3-1b-it –served-model-name gemma3-1b –gpu-memory-utilization 0.7 –enforce-eager

這串指令會啟動 vLLM 並載入指定模型,其中:

  • –model google/gemma-3-1b-it:–model 用來指定要載入的模型,後面的 google/gemma-3-1b-it 則是 Hugging Face 上的模型名稱。
  • –served-model-name gemma3-1b:設定 API 對外使用的模型名稱,之後呼叫 API 時可以使用 gemma3-1b。
  • –gpu-memory-utilization 0.95:設定 vLLM 使用 GPU 記憶體的比例,本範例設定為 95%。

設定共享記憶體

接著,在 [共享記憶體] 的欄位,請依照模型與推論需求決定是否需要啟用共享記憶體。本範例使用的 google/gemma-3-1b-it 模型較小,因此不需要特別配置;若使用較大的模型,則可依實際需求增加。

以上設定完成後,就可以點選右側的 「部署」 按鈕,正式啟動 vLLM 容器。

確認 vLLM 是否成功啟動

部署完成後,點選左側的 「Pod」 選單,等待狀態更新為 Running。當 Pod 正常運行後,勾選該 Pod,選擇 「容器」,再勾選對應的容器並點選 「日誌」。

在日誌畫面中,可以看到 vLLM 容器目前的啟動狀態。持續重新整理日誌內容,當看到:Application startup complete.

就代表 vLLM 已經成功啟動,模型也已完成載入。

設定服務

vLLM 容器成功啟動後,還需要對外開放一個服務窗口,才能讓其他應用程式呼叫這個模型。接下來,我們就到「服務」功能,設定對外的 API Endpoint。

進入「服務」頁面,點選「新增服務」,並依序設定以下內容:

  1. 「名稱」:自訂,建議與剛剛部署的容器名稱一致,方便日後對應管理。
  2. 「類型」:選擇 NodePort。
  3. 「Port」:填入 8000,此為 vLLM 預設對外提供 API 服務的 Port。
  4. 「協定」:選擇 TCP。

設定完成後,點選「新增」即可完成服務建立。

新增完成後,點選該服務即可看到對應的 Endpoint 連結。複製這組連結,就可以用來串接你的 Agent 應用,讓 Gemma-3-1B 模型正式對外提供推論服務! 

以上就是使用 AI-Stack 透過 RCS 部署模型的流程啦!這次我們不只學會如何建立 vLLM 容器、配置 GPU 與儲存空間,也實際示範了 Gated model 的模型授權與 Token 設定。透過 AI-Stack 的 RCS,開發者就能更彈性地部署自己需要的 LLM 模型,快速建立專屬的 AI 推論服務!