Ollama คืออะไร? และรัน LLM เองบน VPS ที่ไม่มี GPU ได้แค่ไหน
ช่วงนี้คำว่า Ollama โผล่ขึ้นมาบ่อยมากในบทสนทนาเรื่อง AI โดยเฉพาะจากคนที่ไม่อยากส่งข้อมูลออกไปให้บริการภายนอก หรืออยากลองเล่นโมเดลภาษาโดยไม่ต้องจ่ายค่า API ต่อการเรียกใช้ทุกครั้ง
บทความนี้อธิบายว่า Ollama คืออะไร ทำอะไรได้จริงบ้าง และที่สำคัญกว่านั้นคือพูดตรง ๆ เรื่องสเปก เพราะการรันโมเดลภาษาบนเซิร์ฟเวอร์ที่มีแต่ CPU ไม่มีการ์ดจอเร่งความเร็ว ให้ประสบการณ์ที่ต่างจากการใช้บริการแชตออนไลน์อย่างชัดเจน เราอยากให้คุณรู้ก่อนตัดสินใจ ไม่ใช่รู้หลังจากจ่ายเงินไปแล้ว
Ollama คืออะไร
Ollama คือโปรแกรมโอเพนซอร์สที่ทำให้การดาวน์โหลดและรันโมเดลภาษาขนาดใหญ่ (LLM) บนเครื่องของคุณเองกลายเป็นเรื่องง่าย จากเดิมที่ต้องประกอบไลบรารีหลายตัว แปลงไฟล์โมเดล และตั้งค่าอีกหลายขั้น Ollama ย่อทั้งหมดให้เหลือแค่คำสั่งเดียวคือ ollama run ตามด้วยชื่อโมเดล มันจะดาวน์โหลดโมเดลมาให้และเปิดหน้าต่างคุยได้ทันที
พูดให้ชัดคือ Ollama ไม่ใช่โมเดล AI แต่เป็นตัวจัดการและตัวรันโมเดล เทียบง่าย ๆ ก็เหมือนเครื่องเล่นที่เปิดไฟล์ได้หลายฟอร์แมต ส่วนโมเดลอย่างตระกูล Llama, Gemma, Qwen, Mistral หรือ DeepSeek คือแผ่นที่คุณเลือกใส่เข้าไป Ollama มีคลังโมเดลของตัวเองให้ดึงมาใช้ และรองรับการเพิ่มโมเดลในรูปแบบมาตรฐานเข้ามาเองได้
จุดที่ทำให้นักพัฒนาชอบคือ Ollama เปิดบริการเป็น API ในตัว โดยค่าเริ่มต้นจะฟังอยู่ที่เครื่องตัวเองที่พอร์ต 11434 ทำให้โปรแกรมอื่นบนเครื่องเดียวกันเรียกใช้โมเดลได้เหมือนเรียกบริการ AI ทั่วไป ไม่ต้องเขียนโค้ดโหลดโมเดลเอง โครงการนี้พัฒนาโดยทีม Ollama บน GitHub และเผยแพร่ภายใต้สัญญาอนุญาตแบบ MIT
Ollama ทำอะไรได้บ้าง
ความสามารถหลักของ Ollama แบ่งได้เป็นสองฝั่ง ฝั่งแรกคือการใช้ผ่านหน้าจอคำสั่งเพื่อคุยกับโมเดลตรง ๆ เหมาะกับการทดลองว่าโมเดลตัวไหนตอบภาษาไทยได้ดีแค่ไหน ฝั่งที่สองคือการใช้เป็นบริการเบื้องหลังให้โปรแกรมอื่นเรียก ซึ่งเป็นวิธีที่คนเอาไปใช้งานจริงมากกว่า
- ดาวน์โหลดและจัดการโมเดล — ดึงโมเดลจากคลังมาเก็บไว้ในเครื่อง สลับไปมาระหว่างหลายโมเดล และลบตัวที่ไม่ใช้ทิ้งเพื่อคืนพื้นที่ดิสก์
- คุยกับโมเดลผ่านหน้าจอคำสั่ง — พิมพ์คำถามแล้วได้คำตอบทันทีในเทอร์มินัล ไม่ต้องเปิดเว็บ ไม่ต้องล็อกอิน
- เปิดเป็น API ให้โปรแกรมอื่นเรียก — ระบบ automation เว็บแอป หรือสคริปต์ของคุณเรียกโมเดลผ่าน HTTP ได้เหมือนเรียกบริการ AI ทั่วไป
- ตั้งค่าพฤติกรรมของโมเดลไว้ล่วงหน้า — กำหนดคำสั่งระบบและพารามิเตอร์ เช่น ความสร้างสรรค์ของคำตอบ แล้วบันทึกเป็นโมเดลเวอร์ชันของคุณเอง
- ทำงานแบบไม่ต้องต่ออินเทอร์เน็ต — เมื่อดาวน์โหลดโมเดลลงเครื่องแล้ว การประมวลผลเกิดขึ้นในเครื่องทั้งหมด ตัดขาดอินเทอร์เน็ตก็ยังใช้ได้
- รองรับงานแปลงข้อความเป็นเวกเตอร์ — โมเดลบางตัวใช้สร้าง embedding สำหรับระบบค้นหาเชิงความหมายหรือระบบถามตอบจากเอกสารของคุณเอง
ทำไมคนถึงอยากรัน LLM เอง
ทั้งที่บริการ AI แบบใช้ผ่านเว็บก็สะดวกและเร็วกว่ามาก คำถามคือแล้วทำไมยังมีคนอยากลำบากรันเอง เหตุผลที่พบบ่อยมีสามข้อหลัก และเกือบทั้งหมดไม่ได้เกี่ยวกับความเร็ว แต่เกี่ยวกับการควบคุม เหตุผลเดียวกันนี้คือเหตุผลที่คนเลือก self-host เครื่องมืออื่น ๆ อย่าง n8n ด้วยเช่นกัน
- ความเป็นส่วนตัวของข้อมูล — ข้อความที่ป้อนเข้าโมเดลไม่ได้ถูกส่งออกไปยังเซิร์ฟเวอร์ของใคร เหมาะกับงานที่มีข้อมูลภายในองค์กร ข้อมูลลูกค้า หรือเอกสารที่มีข้อผูกพันเรื่องการเก็บรักษา
- ไม่มีค่าใช้จ่ายต่อการเรียกใช้ — จ่ายค่าเช่าเครื่องเป็นรายเดือนก้อนเดียว ไม่ว่าจะยิงคำขอกี่ครั้งก็ราคาเท่าเดิม ต่างจากการคิดค่าบริการตามจำนวนโทเคน ซึ่งงานที่ประมวลผลข้อความจำนวนมากซ้ำ ๆ จะบานปลายได้
- ควบคุมเวอร์ชันของโมเดลได้เอง — โมเดลที่คุณดาวน์โหลดไว้จะไม่เปลี่ยนพฤติกรรมกะทันหันเพราะผู้ให้บริการอัปเดตเบื้องหลัง ระบบที่ปรับจูนคำสั่งไว้แล้วจึงให้ผลคงที่กว่า
- ไม่ต้องพึ่งการเชื่อมต่อออกภายนอก — ถ้าบริการภายนอกล่มหรือถูกจำกัดการเข้าถึง ระบบของคุณยังทำงานต่อได้
- ทดลองได้อิสระ — สลับโมเดลไปมา เปรียบเทียบผลลัพธ์ หรือทดสอบคำสั่งระบบหลายแบบได้โดยไม่ต้องกังวลว่าจะเปลืองเครดิต
ความจริงเรื่องสเปก: CPU กับ GPU ต่างกันแค่ไหน
ตรงนี้เป็นส่วนที่เราอยากให้อ่านช้า ๆ เพราะเป็นจุดที่คนผิดหวังกันมากที่สุด แพ็กเกจ VPS ของ Plusweb ทุกตัวไม่มี GPU ไม่มีการ์ดจอสำหรับเร่งการประมวลผล AI ดังนั้นถ้าคุณติดตั้ง Ollama บนเครื่องเหล่านี้ การประมวลผลจะเกิดขึ้นบน CPU และแรมของระบบล้วน ๆ
การรันบน CPU ทำงานได้จริง Ollama รองรับเต็มที่ ไม่ต้องแฮ็กอะไร แต่ความเร็วในการสร้างข้อความออกมาจะช้ากว่าเครื่องที่มี GPU อย่างมีนัยสำคัญ เพราะงานประเภทนี้เป็นการคูณเมทริกซ์จำนวนมหาศาลแบบขนาน ซึ่งเป็นสิ่งที่ GPU ออกแบบมาทำโดยเฉพาะ ส่วน CPU ต้องไล่ทำทีละชุด
ในทางปฏิบัติหมายความว่าอะไร หมายความว่าคำตอบจะทยอยพิมพ์ออกมาช้ากว่าที่คุณคุ้นเคยจากแชตออนไลน์ ยิ่งโมเดลใหญ่ยิ่งช้าลงชัดเจน และถ้ามีหลายคำขอเข้ามาพร้อมกัน แต่ละคำขอจะยิ่งช้าลงไปอีก เพราะทุกคนแย่ง CPU ชุดเดียวกัน เราไม่ระบุตัวเลขความเร็วเป็นโทเคนต่อวินาทีไว้ที่นี่ เพราะมันขึ้นกับรุ่นซีพียู ขนาดโมเดล ระดับการบีบอัด และความยาวบทสนทนา ทางเดียวที่จะรู้จริงคือทดสอบกับโมเดลและงานของคุณเอง
| หัวข้อ | รันบน CPU (VPS ทั่วไป รวมถึงของ Plusweb) | รันบน GPU (เครื่องเฉพาะทาง) |
|---|---|---|
| ทำงานได้หรือไม่ | ได้ Ollama รองรับ CPU เต็มรูปแบบ | ได้ และเป็นเส้นทางที่ออกแบบมาให้เร็วที่สุด |
| ความเร็วในการตอบ | ช้ากว่าอย่างเห็นได้ชัด ยิ่งโมเดลใหญ่ยิ่งช้า | เร็วกว่ามาก ระดับที่รู้สึกว่าตอบทันที |
| ขนาดโมเดลที่เหมาะ | โมเดลเล็กถึงกลางที่บีบอัดแล้ว | รองรับโมเดลใหญ่ได้ตามขนาดหน่วยความจำการ์ด |
| ทรัพยากรที่เป็นคอขวด | RAM ของระบบ และจำนวน/ความเร็วของ CPU core | VRAM บนการ์ดจอเป็นหลัก |
| รองรับผู้ใช้พร้อมกันหลายคน | ไม่เหมาะ ความเร็วตกลงเร็วมากเมื่อมีคำขอซ้อนกัน | ทำได้ดีกว่ามาก |
| เหมาะกับงานแบบไหน | งานเบื้องหลัง งานเป็นชุด งานทดลอง งานที่รอผลได้ | แชตแบบเรียลไทม์ งานที่ต้องตอบทันทีให้คนหมู่มาก |
RAM คือคอขวดตัวจริง
เงื่อนไขข้อแรกของการรันโมเดลไม่ใช่ความเร็ว แต่คือ "โมเดลต้องใส่ลงในแรมได้" ถ้าแรมไม่พอ โมเดลจะโหลดไม่ขึ้นหรือระบบจะเริ่มสลับข้อมูลลงดิสก์ ซึ่งทำให้ช้าลงจนใช้งานไม่ได้จริง ดังนั้นก่อนดูเรื่องความเร็ว ให้ดูก่อนว่าโมเดลที่อยากใช้กินแรมเท่าไหร่
ปริมาณแรมที่ต้องใช้ขึ้นกับสองอย่าง คือจำนวนพารามิเตอร์ของโมเดล และระดับการบีบอัด (quantization) ที่ใช้ โมเดลที่บีบอัดมาระดับ 4 บิตซึ่งเป็นค่ามาตรฐานที่คนใช้กันมากที่สุด จะกินพื้นที่ประมาณครึ่งกิกะไบต์เศษ ๆ ต่อหนึ่งพันล้านพารามิเตอร์ แล้วต้องเผื่อเพิ่มอีกส่วนสำหรับบทสนทนาที่ยาวขึ้น รวมถึงเผื่อให้ระบบปฏิบัติการและบริการอื่นบนเครื่องด้วย
ตารางด้านล่างเป็นตัวเลขคร่าว ๆ เพื่อให้เห็นภาพเท่านั้น ไม่ใช่ค่าที่การันตี เพราะโมเดลแต่ละตระกูลกินแรมไม่เท่ากันแม้จำนวนพารามิเตอร์ใกล้กัน และการตั้งค่าความยาวบทสนทนาก็มีผลมาก ควรตรวจขนาดไฟล์จริงของโมเดลที่คุณจะใช้จากคลังโมเดลของ Ollama ก่อนเลือกแพ็กเกจ
| ขนาดโมเดล | พื้นที่โดยประมาณเมื่อบีบอัด 4 บิต | แรมทั้งเครื่องที่ควรมี | แพ็กเกจที่พอเป็นไปได้ |
|---|---|---|---|
| ราว 1 พันล้านพารามิเตอร์ | ต่ำกว่า 1 GB | 3 GB ขึ้นไป | VPS-01 (3 GB) ขึ้นไป |
| ราว 3 พันล้านพารามิเตอร์ | ประมาณ 2 GB | 4 GB ขึ้นไป | VPS-02 (4 GB) ขึ้นไป |
| ราว 7–8 พันล้านพารามิเตอร์ | ประมาณ 4–5 GB | 8 GB ขึ้นไป | VPS-03 (8 GB) ขึ้นไป |
| ราว 13–14 พันล้านพารามิเตอร์ | ประมาณ 8–9 GB | 16 GB ขึ้นไป | VPS-06 (16 GB) เท่านั้น |
| 30 พันล้านพารามิเตอร์ขึ้นไป | เกิน 18 GB | เกินกว่าที่แพ็กเกจของเรามี | ไม่รองรับ ต้องใช้เครื่องสเปกอื่น |
เคสไหนคุ้มที่จะรันบน VPS ที่ไม่มี GPU และเคสไหนไม่คุ้ม
เมื่อเข้าใจข้อจำกัดแล้ว คำถามที่เหลือคือแล้วมันเหมาะกับงานแบบไหน คำตอบสั้น ๆ คืองานที่ "รอได้" และ "ทำเบื้องหลัง" คุ้มค่าที่สุด ส่วนงานที่ต้องตอบทันทีให้คนจำนวนมากคือกลุ่มที่ไม่ควรใช้เส้นทางนี้เลย
| ลักษณะงาน | รันบน VPS ที่ไม่มี GPU | เหตุผล |
|---|---|---|
| สรุปหรือจัดหมวดข้อความเป็นชุดในเวลากลางคืน | คุ้ม | ไม่มีใครรอผลแบบเรียลไทม์ ปล่อยให้เครื่องค่อย ๆ ทำได้ |
| เติมแท็กหรือดึงข้อมูลจากเอกสารภายใน | คุ้ม | งานเป็นรอบ ๆ และข้อมูลไม่ควรออกนอกองค์กร |
| ทดลองและเปรียบเทียบโมเดลก่อนตัดสินใจลงทุน | คุ้ม | ต้นทุนต่อเดือนคงที่ ทดลองกี่ครั้งก็ได้ |
| ผู้ช่วยส่วนตัวใช้คนเดียว ที่ยอมรอคำตอบได้ | พอไหว | ใช้ได้ถ้าเลือกโมเดลเล็กและไม่รีบ |
| ต่อกับระบบ automation ให้ช่วยเขียนข้อความสั้น ๆ | พอไหว | ต้องออกแบบให้ระบบรอผลได้ ไม่ใช่ตอบกลับผู้ใช้ทันที |
| แชตบอตหน้าเว็บที่ลูกค้าหลายคนใช้พร้อมกัน | ไม่คุ้ม | ความเร็วตกทันทีเมื่อมีคำขอซ้อนกัน ผู้ใช้จะรู้สึกได้ |
| งานที่ต้องใช้โมเดลใหญ่เพื่อคุณภาพสูงสุด | ไม่คุ้ม | โมเดลใหญ่ใส่ไม่ลงแรม และช้าเกินกว่าจะใช้จริง |
| สร้างภาพหรือวิดีโอด้วย AI | ไม่คุ้ม | งานกลุ่มนี้ต้องการ GPU แทบจะบังคับ |
ภาพรวมการติดตั้ง Ollama บน VPS
การติดตั้งไม่ซับซ้อน ผู้พัฒนามีสคริปต์ติดตั้งอย่างเป็นทางการสำหรับ Linux ให้อยู่แล้ว และถ้าคุณคุ้นเคยกับ Docker ก็เลือกรันในคอนเทนเนอร์ได้เช่นกัน ขั้นตอนด้านล่างเป็นภาพรวมให้เห็นว่าต้องผ่านอะไรบ้าง ไม่ใช่คู่มือแบบคัดลอกวาง เพราะรายละเอียดคำสั่งอาจเปลี่ยนตามเวอร์ชัน ให้ยึดตามเอกสารทางการเป็นหลักเสมอ
- 1เลือกแพ็กเกจให้แรมพอกับโมเดลที่ตั้งใจใช้ก่อน โดยดูจากตารางแรมด้านบน แล้วเผื่อพื้นที่ดิสก์สำหรับไฟล์โมเดลด้วย
- 2เตรียมเครื่อง Linux ให้พร้อม อัปเดตแพ็กเกจของระบบให้เป็นปัจจุบัน และสร้างผู้ใช้ทั่วไปสำหรับทำงานแทนการใช้บัญชี root ตลอดเวลา
- 3ตั้งไฟร์วอลล์ให้เปิดเฉพาะพอร์ตที่จำเป็นตั้งแต่ต้น อย่างน้อยคือพอร์ตสำหรับเข้าใช้งานระยะไกล และปิดพอร์ตอื่นไว้ก่อน
- 4ติดตั้ง Ollama ด้วยสคริปต์ติดตั้งอย่างเป็นทางการจากเว็บไซต์ผู้พัฒนา หรือเลือกใช้อิมเมจคอนเทนเนอร์ถ้าเครื่องคุณจัดการทุกอย่างด้วย Docker อยู่แล้ว
- 5ตั้งให้ Ollama ทำงานเป็นบริการของระบบ เพื่อให้กลับมาทำงานเองหลังเครื่องรีสตาร์ต ตัวติดตั้งบน Linux จะจัดการส่วนนี้ให้อยู่แล้วในกรณีทั่วไป
- 6ดาวน์โหลดโมเดลด้วยคำสั่ง ollama pull ตามด้วยชื่อโมเดล แนะนำให้เริ่มจากโมเดลเล็กที่สุดที่ยอมรับคุณภาพได้ก่อน แล้วค่อยขยับขึ้นถ้าเครื่องยังไหว
- 7ทดสอบด้วยคำสั่ง ollama run แล้วลองถามงานจริงที่คุณตั้งใจจะใช้ พร้อมจับเวลาว่าตอบเสร็จภายในเวลาที่รับได้หรือไม่ ขั้นนี้สำคัญที่สุด เพราะเป็นตัวตัดสินว่าเส้นทางนี้เวิร์กกับคุณจริงไหม
- 8ถ้าจะให้โปรแกรมอื่นเรียกใช้ ให้เชื่อมผ่านเครือข่ายภายในเครื่องหรือเครือข่ายส่วนตัวเท่านั้น และอ่านหัวข้อความปลอดภัยถัดไปก่อนเปิดให้เข้าถึงจากภายนอก
- 9เฝ้าดูการใช้แรมและพื้นที่ดิสก์ในช่วงสัปดาห์แรก เพราะไฟล์โมเดลที่ทดลองไว้หลายตัวมักกินดิสก์เกินที่คาดไว้
ข้อควรระวังด้านความปลอดภัย
เรื่องนี้สำคัญกว่าที่หลายคนคิด โดยค่าเริ่มต้น Ollama จะฟังอยู่ที่ 127.0.0.1 พอร์ต 11434 ซึ่งหมายถึงเฉพาะโปรแกรมบนเครื่องเดียวกันเท่านั้นที่เรียกได้ นี่เป็นค่าเริ่มต้นที่ปลอดภัยและควรเก็บไว้แบบนั้น
ปัญหาเกิดตอนที่คนอยากเรียกใช้จากเครื่องอื่น แล้วไปเปลี่ยนการผูกที่อยู่ให้รับจากทุกที่ ถ้าทำแบบนั้นบนเครื่องที่มี IP สาธารณะโดยไม่กั้นไฟร์วอลล์ เท่ากับเปิด API ให้ทั้งอินเทอร์เน็ตใช้ได้ และประเด็นสำคัญคือ Ollama ไม่ได้มีระบบยืนยันตัวตนมาให้ในตัว ใครที่ต่อถึงพอร์ตนั้นได้ก็สั่งงานโมเดล ดูรายการโมเดล หรือแม้แต่ลบโมเดลของคุณได้ ทั้งหมดนี้กินทรัพยากรเครื่องที่คุณจ่ายเงินอยู่ มีรายงานจากการสแกนทั่วอินเทอร์เน็ตว่าพบเซิร์ฟเวอร์ Ollama ที่เปิดทิ้งไว้แบบนี้เป็นจำนวนมาก ซึ่งส่วนใหญ่น่าจะไม่ได้ตั้งใจ
- อย่าเปิดพอร์ตของ Ollama ออกสู่อินเทอร์เน็ตตรง ๆ โดยเด็ดขาด ให้คงค่าเริ่มต้นที่ฟังเฉพาะในเครื่องไว้ถ้าทำได้
- ถ้าจำเป็นต้องเรียกจากภายนอก ให้วางตัวรับหน้าที่มีการยืนยันตัวตนไว้ข้างหน้า แล้วให้มันส่งต่อไปยัง Ollama ที่ฟังอยู่ในเครื่องอีกที ไม่ใช่เปิดพอร์ตตรง
- จำกัดด้วยไฟร์วอลล์เสมอ อนุญาตเฉพาะที่อยู่ต้นทางที่คุณรู้จัก ไม่ใช่เปิดกว้างแล้วค่อยมาไล่ปิดทีหลัง
- อย่าคิดว่าการที่ไม่มีใครรู้พอร์ตคือความปลอดภัย เพราะเครื่องมือสแกนหาบริการที่เปิดอยู่ทำงานตลอดเวลาและเจอได้ในไม่กี่ชั่วโมง
- เฝ้าดูการใช้ทรัพยากรของเครื่อง ถ้า CPU ทำงานเต็มโดยที่คุณไม่ได้สั่งอะไร นั่นเป็นสัญญาณว่ามีคนอื่นกำลังใช้เครื่องคุณอยู่
- ระวังข้อมูลที่ป้อนเข้าโมเดลเช่นกัน แม้จะประมวลผลในเครื่อง แต่บันทึกการทำงานที่เก็บไว้ก็อาจมีข้อมูลอ่อนไหวติดอยู่ ควรกำหนดสิทธิ์ไฟล์และอายุการเก็บให้เหมาะสม
สรุป
Ollama คือเครื่องมือที่ทำให้การรันโมเดลภาษาบนเครื่องของตัวเองกลายเป็นเรื่องที่คนทั่วไปทำได้ จุดแข็งจริง ๆ ของมันคือความเป็นส่วนตัว ต้นทุนคงที่ และการควบคุมเวอร์ชัน ไม่ใช่ความเร็ว
ถ้าจะเอาขึ้น VPS โปรดจำสองข้อนี้ไว้ให้แม่น หนึ่งคือแรมต้องพอให้โมเดลใส่ลงไปได้ก่อน สองคือแพ็กเกจของเราไม่มี GPU ความเร็วจึงเหมาะกับงานเบื้องหลังและงานเป็นชุด ไม่ใช่แชตเรียลไทม์สำหรับผู้ใช้หลายคน ถ้าคุณต้องการอย่างหลัง คุณต้องการเครื่องที่มี GPU ซึ่งเป็นคนละผลิตภัณฑ์กัน
ทางที่แนะนำคือเริ่มเล็กแล้ววัดผลจริง เช่าเครื่องแรมพอประมาณ ลองโมเดลเล็กกับงานจริงของคุณ จับเวลาดูว่ารับได้ไหม ถ้ารับได้ค่อยขยับขึ้น ถ้ารับไม่ได้ก็รู้ตั้งแต่ต้นเดือนแรกโดยเสียค่าทดลองไม่มาก ดู แพ็กเกจ VPS ทั้งหมด เพื่อเทียบแรมและราคาได้
ถ้าสนใจการ self-host เครื่องมืออื่นบนเครื่องเดียวกัน ลองอ่าน Coolify คืออะไร สำหรับการ deploy เว็บและบริการต่าง ๆ หรือ n8n สำหรับระบบ automation ที่เรียก Ollama ให้ช่วยประมวลผลข้อความในเวิร์กโฟลว์ได้
อยากลองรัน LLM ของตัวเองดูสักตั้ง?
VPS ของ Plusweb มีสิทธิ์ root เต็มและ Public IPv4 ในตัว เลือกแรมให้พอกับโมเดลที่จะใช้ (ทุกแพ็กเกจเป็นเครื่อง CPU ไม่มี GPU)
คำถามที่พบบ่อย
Ollama คืออะไรแบบสั้นที่สุด?
Ollama คือโปรแกรมโอเพนซอร์สที่ใช้ดาวน์โหลดและรันโมเดลภาษาขนาดใหญ่บนเครื่องของคุณเอง ไม่ว่าจะเป็นคอมส่วนตัวหรือเซิร์ฟเวอร์ที่เช่าไว้ ตัวมันไม่ใช่โมเดล AI แต่เป็นตัวจัดการและตัวรันโมเดล พร้อมเปิดเป็น API ให้โปรแกรมอื่นเรียกใช้ได้ด้วย เผยแพร่ภายใต้สัญญาอนุญาต MIT
รัน Ollama บน VPS ที่ไม่มี GPU ได้ไหม เร็วแค่ไหน?
ได้ Ollama รองรับการทำงานบน CPU เต็มรูปแบบ แต่ต้องยอมรับว่าช้ากว่าเครื่องที่มี GPU อย่างชัดเจน คำตอบจะทยอยออกมาช้ากว่าที่คุ้นเคยจากบริการแชตออนไลน์ และยิ่งโมเดลใหญ่ยิ่งช้าลง ความเร็วจริงขึ้นกับรุ่นซีพียู ขนาดโมเดล และความยาวบทสนทนา จึงควรทดสอบกับงานของคุณเองก่อนตัดสินใจ
ต้องใช้แรมเท่าไหร่ถึงจะรันได้?
หลักคือโมเดลต้องใส่ลงในแรมได้ทั้งก้อน ถ้าใช้โมเดลที่บีบอัดระดับ 4 บิตซึ่งเป็นมาตรฐานที่นิยม จะกินพื้นที่ประมาณครึ่งกิกะไบต์เศษต่อหนึ่งพันล้านพารามิเตอร์ แล้วต้องเผื่อสำหรับบทสนทนาและระบบปฏิบัติการอีก ในทางปฏิบัติควรเริ่มที่แรม 4 GB ขึ้นไปสำหรับโมเดลเล็ก และ 8 GB ขึ้นไปถ้าจะใช้โมเดลระดับ 7–8 พันล้านพารามิเตอร์
Plusweb มีแพ็กเกจที่มี GPU ไหม?
ไม่มี แพ็กเกจ VPS ทุกตัวของเราเป็นเครื่องที่ใช้ CPU และแรมของระบบเท่านั้น ไม่มีการ์ดจอสำหรับเร่งการประมวลผล AI ดังนั้นถ้างานของคุณต้องการการประมวลผลโมเดลใหญ่แบบรวดเร็วหรือให้บริการผู้ใช้หลายคนพร้อมกัน ควรมองหาเครื่องที่มี GPU ซึ่งเป็นผลิตภัณฑ์คนละแบบกัน
งานแบบไหนที่รัน Ollama บน VPS แล้วคุ้มจริง?
งานที่ไม่มีใครนั่งรอผลแบบเรียลไทม์ เช่น สรุปหรือจัดหมวดข้อความเป็นชุดในเวลากลางคืน ดึงข้อมูลจากเอกสารภายในองค์กรที่ไม่อยากส่งออกนอก ทดลองเปรียบเทียบโมเดลก่อนลงทุนจริง หรือเป็นเครื่องยนต์เบื้องหลังให้ระบบ automation ที่ออกแบบมาให้รอผลได้ ส่วนแชตบอตหน้าเว็บที่ลูกค้าหลายคนใช้พร้อมกันไม่เหมาะกับเส้นทางนี้
เปิด API ของ Ollama ให้เข้าถึงจากอินเทอร์เน็ตได้ไหม?
ไม่ควรเปิดตรง ๆ เด็ดขาด เพราะ Ollama ไม่มีระบบยืนยันตัวตนมาให้ในตัว ใครที่ต่อถึงพอร์ตได้ก็สั่งงานโมเดลและกินทรัพยากรเครื่องคุณได้ทันที ค่าเริ่มต้นของมันคือฟังเฉพาะในเครื่องที่พอร์ต 11434 ซึ่งควรคงไว้ ถ้าจำเป็นต้องเรียกจากภายนอกจริง ให้วางตัวรับหน้าที่บังคับยืนยันตัวตนไว้ข้างหน้าแล้วส่งต่อเข้ามา พร้อมจำกัดด้วยไฟร์วอลล์เสมอ
GUIDES
บทความที่เกี่ยวข้อง
อ่านต่อในหัวข้อใกล้เคียง
Docker คืออะไร? อธิบายแบบเห็นภาพ พร้อมวิธีใช้จริงบน VPS
Docker คือเครื่องมือที่ห่อแอปพร้อมทุกอย่างที่มันต้องใช้ไว้ในกล่องเดียว ทำให้รันที่ไหนก็ได้ผลเหมือนกัน อ่านให้เข้าใจศัพท์หลัก ความต่างจาก VM และเหตุผลที่คนเช่า VPS นิยมลง
อ่านต่อn8n คืออะไร? เครื่องมือ Workflow Automation ที่ต่อทุกแอปเข้าด้วยกัน
n8n คืออะไร ทำอะไรได้บ้าง ต่างจากเครื่องมือ automation ตัวอื่นยังไง และทำไมคนถึงเลือก self-host — อธิบายศัพท์ Node / Trigger / Workflow / Execution / Credential แบบเข้าใจง่ายตั้งแต่ศูนย์
อ่านต่อVPS คืออะไร? ใช้ทำอะไรได้บ้าง ฉบับเข้าใจง่าย
สรุปครบเรื่อง VPS — VPS server คืออะไร ทำงานยังไง Cloud VPS ต่างจาก VPS ทั่วไปตรงไหน ใช้ทำอะไรได้บ้าง เทียบกับ Shared Hosting และ Dedicated ใครควรใช้ และเริ่มต้นยังไงในปี 2026
อ่านต่อ