Automation & VPS

Ollama คืออะไร? และรัน LLM เองบน VPS ที่ไม่มี GPU ได้แค่ไหน

อัปเดต 2026-08-22อ่าน ~9 นาที

ช่วงนี้คำว่า Ollama โผล่ขึ้นมาบ่อยมากในบทสนทนาเรื่อง AI โดยเฉพาะจากคนที่ไม่อยากส่งข้อมูลออกไปให้บริการภายนอก หรืออยากลองเล่นโมเดลภาษาโดยไม่ต้องจ่ายค่า API ต่อการเรียกใช้ทุกครั้ง

บทความนี้อธิบายว่า Ollama คืออะไร ทำอะไรได้จริงบ้าง และที่สำคัญกว่านั้นคือพูดตรง ๆ เรื่องสเปก เพราะการรันโมเดลภาษาบนเซิร์ฟเวอร์ที่มีแต่ CPU ไม่มีการ์ดจอเร่งความเร็ว ให้ประสบการณ์ที่ต่างจากการใช้บริการแชตออนไลน์อย่างชัดเจน เราอยากให้คุณรู้ก่อนตัดสินใจ ไม่ใช่รู้หลังจากจ่ายเงินไปแล้ว

Ollama คืออะไร

Ollama คือโปรแกรมโอเพนซอร์สที่ทำให้การดาวน์โหลดและรันโมเดลภาษาขนาดใหญ่ (LLM) บนเครื่องของคุณเองกลายเป็นเรื่องง่าย จากเดิมที่ต้องประกอบไลบรารีหลายตัว แปลงไฟล์โมเดล และตั้งค่าอีกหลายขั้น Ollama ย่อทั้งหมดให้เหลือแค่คำสั่งเดียวคือ ollama run ตามด้วยชื่อโมเดล มันจะดาวน์โหลดโมเดลมาให้และเปิดหน้าต่างคุยได้ทันที

พูดให้ชัดคือ Ollama ไม่ใช่โมเดล AI แต่เป็นตัวจัดการและตัวรันโมเดล เทียบง่าย ๆ ก็เหมือนเครื่องเล่นที่เปิดไฟล์ได้หลายฟอร์แมต ส่วนโมเดลอย่างตระกูล Llama, Gemma, Qwen, Mistral หรือ DeepSeek คือแผ่นที่คุณเลือกใส่เข้าไป Ollama มีคลังโมเดลของตัวเองให้ดึงมาใช้ และรองรับการเพิ่มโมเดลในรูปแบบมาตรฐานเข้ามาเองได้

จุดที่ทำให้นักพัฒนาชอบคือ Ollama เปิดบริการเป็น API ในตัว โดยค่าเริ่มต้นจะฟังอยู่ที่เครื่องตัวเองที่พอร์ต 11434 ทำให้โปรแกรมอื่นบนเครื่องเดียวกันเรียกใช้โมเดลได้เหมือนเรียกบริการ AI ทั่วไป ไม่ต้องเขียนโค้ดโหลดโมเดลเอง โครงการนี้พัฒนาโดยทีม Ollama บน GitHub และเผยแพร่ภายใต้สัญญาอนุญาตแบบ MIT

💡 สรุปสั้น: Ollama = ตัวรันโมเดลภาษาบนเครื่องของคุณเอง ไม่ใช่ตัวโมเดล ไม่ใช่บริการคลาวด์ และไม่ได้ส่งข้อความของคุณออกไปข้างนอกในการใช้งานปกติ

Ollama ทำอะไรได้บ้าง

ความสามารถหลักของ Ollama แบ่งได้เป็นสองฝั่ง ฝั่งแรกคือการใช้ผ่านหน้าจอคำสั่งเพื่อคุยกับโมเดลตรง ๆ เหมาะกับการทดลองว่าโมเดลตัวไหนตอบภาษาไทยได้ดีแค่ไหน ฝั่งที่สองคือการใช้เป็นบริการเบื้องหลังให้โปรแกรมอื่นเรียก ซึ่งเป็นวิธีที่คนเอาไปใช้งานจริงมากกว่า

  • ดาวน์โหลดและจัดการโมเดล — ดึงโมเดลจากคลังมาเก็บไว้ในเครื่อง สลับไปมาระหว่างหลายโมเดล และลบตัวที่ไม่ใช้ทิ้งเพื่อคืนพื้นที่ดิสก์
  • คุยกับโมเดลผ่านหน้าจอคำสั่ง — พิมพ์คำถามแล้วได้คำตอบทันทีในเทอร์มินัล ไม่ต้องเปิดเว็บ ไม่ต้องล็อกอิน
  • เปิดเป็น API ให้โปรแกรมอื่นเรียก — ระบบ automation เว็บแอป หรือสคริปต์ของคุณเรียกโมเดลผ่าน HTTP ได้เหมือนเรียกบริการ AI ทั่วไป
  • ตั้งค่าพฤติกรรมของโมเดลไว้ล่วงหน้า — กำหนดคำสั่งระบบและพารามิเตอร์ เช่น ความสร้างสรรค์ของคำตอบ แล้วบันทึกเป็นโมเดลเวอร์ชันของคุณเอง
  • ทำงานแบบไม่ต้องต่ออินเทอร์เน็ต — เมื่อดาวน์โหลดโมเดลลงเครื่องแล้ว การประมวลผลเกิดขึ้นในเครื่องทั้งหมด ตัดขาดอินเทอร์เน็ตก็ยังใช้ได้
  • รองรับงานแปลงข้อความเป็นเวกเตอร์ — โมเดลบางตัวใช้สร้าง embedding สำหรับระบบค้นหาเชิงความหมายหรือระบบถามตอบจากเอกสารของคุณเอง
💡 ในทางปฏิบัติ คนส่วนใหญ่ที่เอา Ollama ขึ้นเซิร์ฟเวอร์ ไม่ได้เอาไปนั่งแชตเล่น แต่เอาไปเป็นเครื่องยนต์เบื้องหลังให้ระบบอื่นเรียกใช้

ทำไมคนถึงอยากรัน LLM เอง

ทั้งที่บริการ AI แบบใช้ผ่านเว็บก็สะดวกและเร็วกว่ามาก คำถามคือแล้วทำไมยังมีคนอยากลำบากรันเอง เหตุผลที่พบบ่อยมีสามข้อหลัก และเกือบทั้งหมดไม่ได้เกี่ยวกับความเร็ว แต่เกี่ยวกับการควบคุม เหตุผลเดียวกันนี้คือเหตุผลที่คนเลือก self-host เครื่องมืออื่น ๆ อย่าง n8n ด้วยเช่นกัน

  • ความเป็นส่วนตัวของข้อมูล — ข้อความที่ป้อนเข้าโมเดลไม่ได้ถูกส่งออกไปยังเซิร์ฟเวอร์ของใคร เหมาะกับงานที่มีข้อมูลภายในองค์กร ข้อมูลลูกค้า หรือเอกสารที่มีข้อผูกพันเรื่องการเก็บรักษา
  • ไม่มีค่าใช้จ่ายต่อการเรียกใช้ — จ่ายค่าเช่าเครื่องเป็นรายเดือนก้อนเดียว ไม่ว่าจะยิงคำขอกี่ครั้งก็ราคาเท่าเดิม ต่างจากการคิดค่าบริการตามจำนวนโทเคน ซึ่งงานที่ประมวลผลข้อความจำนวนมากซ้ำ ๆ จะบานปลายได้
  • ควบคุมเวอร์ชันของโมเดลได้เอง — โมเดลที่คุณดาวน์โหลดไว้จะไม่เปลี่ยนพฤติกรรมกะทันหันเพราะผู้ให้บริการอัปเดตเบื้องหลัง ระบบที่ปรับจูนคำสั่งไว้แล้วจึงให้ผลคงที่กว่า
  • ไม่ต้องพึ่งการเชื่อมต่อออกภายนอก — ถ้าบริการภายนอกล่มหรือถูกจำกัดการเข้าถึง ระบบของคุณยังทำงานต่อได้
  • ทดลองได้อิสระ — สลับโมเดลไปมา เปรียบเทียบผลลัพธ์ หรือทดสอบคำสั่งระบบหลายแบบได้โดยไม่ต้องกังวลว่าจะเปลืองเครดิต
💡 ข้อสำคัญ: การรันเองแลกมาด้วยความเร็วและคุณภาพของโมเดลที่ต่ำลง โมเดลขนาดที่รันได้บนเครื่องเช่าทั่วไปยังห่างจากโมเดลระดับบนสุดของผู้ให้บริการรายใหญ่อยู่พอสมควร นี่คือการแลกเปลี่ยนที่ต้องยอมรับตั้งแต่ต้น

ความจริงเรื่องสเปก: CPU กับ GPU ต่างกันแค่ไหน

ตรงนี้เป็นส่วนที่เราอยากให้อ่านช้า ๆ เพราะเป็นจุดที่คนผิดหวังกันมากที่สุด แพ็กเกจ VPS ของ Plusweb ทุกตัวไม่มี GPU ไม่มีการ์ดจอสำหรับเร่งการประมวลผล AI ดังนั้นถ้าคุณติดตั้ง Ollama บนเครื่องเหล่านี้ การประมวลผลจะเกิดขึ้นบน CPU และแรมของระบบล้วน ๆ

การรันบน CPU ทำงานได้จริง Ollama รองรับเต็มที่ ไม่ต้องแฮ็กอะไร แต่ความเร็วในการสร้างข้อความออกมาจะช้ากว่าเครื่องที่มี GPU อย่างมีนัยสำคัญ เพราะงานประเภทนี้เป็นการคูณเมทริกซ์จำนวนมหาศาลแบบขนาน ซึ่งเป็นสิ่งที่ GPU ออกแบบมาทำโดยเฉพาะ ส่วน CPU ต้องไล่ทำทีละชุด

ในทางปฏิบัติหมายความว่าอะไร หมายความว่าคำตอบจะทยอยพิมพ์ออกมาช้ากว่าที่คุณคุ้นเคยจากแชตออนไลน์ ยิ่งโมเดลใหญ่ยิ่งช้าลงชัดเจน และถ้ามีหลายคำขอเข้ามาพร้อมกัน แต่ละคำขอจะยิ่งช้าลงไปอีก เพราะทุกคนแย่ง CPU ชุดเดียวกัน เราไม่ระบุตัวเลขความเร็วเป็นโทเคนต่อวินาทีไว้ที่นี่ เพราะมันขึ้นกับรุ่นซีพียู ขนาดโมเดล ระดับการบีบอัด และความยาวบทสนทนา ทางเดียวที่จะรู้จริงคือทดสอบกับโมเดลและงานของคุณเอง

หัวข้อรันบน CPU (VPS ทั่วไป รวมถึงของ Plusweb)รันบน GPU (เครื่องเฉพาะทาง)
ทำงานได้หรือไม่ได้ Ollama รองรับ CPU เต็มรูปแบบได้ และเป็นเส้นทางที่ออกแบบมาให้เร็วที่สุด
ความเร็วในการตอบช้ากว่าอย่างเห็นได้ชัด ยิ่งโมเดลใหญ่ยิ่งช้าเร็วกว่ามาก ระดับที่รู้สึกว่าตอบทันที
ขนาดโมเดลที่เหมาะโมเดลเล็กถึงกลางที่บีบอัดแล้วรองรับโมเดลใหญ่ได้ตามขนาดหน่วยความจำการ์ด
ทรัพยากรที่เป็นคอขวดRAM ของระบบ และจำนวน/ความเร็วของ CPU coreVRAM บนการ์ดจอเป็นหลัก
รองรับผู้ใช้พร้อมกันหลายคนไม่เหมาะ ความเร็วตกลงเร็วมากเมื่อมีคำขอซ้อนกันทำได้ดีกว่ามาก
เหมาะกับงานแบบไหนงานเบื้องหลัง งานเป็นชุด งานทดลอง งานที่รอผลได้แชตแบบเรียลไทม์ งานที่ต้องตอบทันทีให้คนหมู่มาก
💡 พูดให้ชัดที่สุด: ถ้าเป้าหมายของคุณคือประสบการณ์แชตที่ลื่นเหมือนบริการ AI ชื่อดัง สำหรับผู้ใช้หลายคนพร้อมกัน คุณต้องการเครื่องที่มี GPU ซึ่งแพ็กเกจ VPS ของเราไม่ใช่ อย่าซื้อด้วยความคาดหวังนั้น

RAM คือคอขวดตัวจริง

เงื่อนไขข้อแรกของการรันโมเดลไม่ใช่ความเร็ว แต่คือ "โมเดลต้องใส่ลงในแรมได้" ถ้าแรมไม่พอ โมเดลจะโหลดไม่ขึ้นหรือระบบจะเริ่มสลับข้อมูลลงดิสก์ ซึ่งทำให้ช้าลงจนใช้งานไม่ได้จริง ดังนั้นก่อนดูเรื่องความเร็ว ให้ดูก่อนว่าโมเดลที่อยากใช้กินแรมเท่าไหร่

ปริมาณแรมที่ต้องใช้ขึ้นกับสองอย่าง คือจำนวนพารามิเตอร์ของโมเดล และระดับการบีบอัด (quantization) ที่ใช้ โมเดลที่บีบอัดมาระดับ 4 บิตซึ่งเป็นค่ามาตรฐานที่คนใช้กันมากที่สุด จะกินพื้นที่ประมาณครึ่งกิกะไบต์เศษ ๆ ต่อหนึ่งพันล้านพารามิเตอร์ แล้วต้องเผื่อเพิ่มอีกส่วนสำหรับบทสนทนาที่ยาวขึ้น รวมถึงเผื่อให้ระบบปฏิบัติการและบริการอื่นบนเครื่องด้วย

ตารางด้านล่างเป็นตัวเลขคร่าว ๆ เพื่อให้เห็นภาพเท่านั้น ไม่ใช่ค่าที่การันตี เพราะโมเดลแต่ละตระกูลกินแรมไม่เท่ากันแม้จำนวนพารามิเตอร์ใกล้กัน และการตั้งค่าความยาวบทสนทนาก็มีผลมาก ควรตรวจขนาดไฟล์จริงของโมเดลที่คุณจะใช้จากคลังโมเดลของ Ollama ก่อนเลือกแพ็กเกจ

ขนาดโมเดลพื้นที่โดยประมาณเมื่อบีบอัด 4 บิตแรมทั้งเครื่องที่ควรมีแพ็กเกจที่พอเป็นไปได้
ราว 1 พันล้านพารามิเตอร์ต่ำกว่า 1 GB3 GB ขึ้นไปVPS-01 (3 GB) ขึ้นไป
ราว 3 พันล้านพารามิเตอร์ประมาณ 2 GB4 GB ขึ้นไปVPS-02 (4 GB) ขึ้นไป
ราว 7–8 พันล้านพารามิเตอร์ประมาณ 4–5 GB8 GB ขึ้นไปVPS-03 (8 GB) ขึ้นไป
ราว 13–14 พันล้านพารามิเตอร์ประมาณ 8–9 GB16 GB ขึ้นไปVPS-06 (16 GB) เท่านั้น
30 พันล้านพารามิเตอร์ขึ้นไปเกิน 18 GBเกินกว่าที่แพ็กเกจของเรามีไม่รองรับ ต้องใช้เครื่องสเปกอื่น
💡 VPS-00 ที่มีแรม 1 GB ไม่เหมาะกับงานนี้ เพราะแทบไม่เหลือที่ให้โมเดลหลังหักส่วนของระบบปฏิบัติการ ถ้าตั้งใจจะลอง Ollama จริง ๆ ควรเริ่มที่แรม 4 GB ขึ้นไป และอย่าลืมว่าไฟล์โมเดลกินพื้นที่ดิสก์ด้วย เก็บหลายโมเดลไว้พร้อมกันดิสก์เต็มได้ง่าย

เคสไหนคุ้มที่จะรันบน VPS ที่ไม่มี GPU และเคสไหนไม่คุ้ม

เมื่อเข้าใจข้อจำกัดแล้ว คำถามที่เหลือคือแล้วมันเหมาะกับงานแบบไหน คำตอบสั้น ๆ คืองานที่ "รอได้" และ "ทำเบื้องหลัง" คุ้มค่าที่สุด ส่วนงานที่ต้องตอบทันทีให้คนจำนวนมากคือกลุ่มที่ไม่ควรใช้เส้นทางนี้เลย

ลักษณะงานรันบน VPS ที่ไม่มี GPUเหตุผล
สรุปหรือจัดหมวดข้อความเป็นชุดในเวลากลางคืนคุ้มไม่มีใครรอผลแบบเรียลไทม์ ปล่อยให้เครื่องค่อย ๆ ทำได้
เติมแท็กหรือดึงข้อมูลจากเอกสารภายในคุ้มงานเป็นรอบ ๆ และข้อมูลไม่ควรออกนอกองค์กร
ทดลองและเปรียบเทียบโมเดลก่อนตัดสินใจลงทุนคุ้มต้นทุนต่อเดือนคงที่ ทดลองกี่ครั้งก็ได้
ผู้ช่วยส่วนตัวใช้คนเดียว ที่ยอมรอคำตอบได้พอไหวใช้ได้ถ้าเลือกโมเดลเล็กและไม่รีบ
ต่อกับระบบ automation ให้ช่วยเขียนข้อความสั้น ๆพอไหวต้องออกแบบให้ระบบรอผลได้ ไม่ใช่ตอบกลับผู้ใช้ทันที
แชตบอตหน้าเว็บที่ลูกค้าหลายคนใช้พร้อมกันไม่คุ้มความเร็วตกทันทีเมื่อมีคำขอซ้อนกัน ผู้ใช้จะรู้สึกได้
งานที่ต้องใช้โมเดลใหญ่เพื่อคุณภาพสูงสุดไม่คุ้มโมเดลใหญ่ใส่ไม่ลงแรม และช้าเกินกว่าจะใช้จริง
สร้างภาพหรือวิดีโอด้วย AIไม่คุ้มงานกลุ่มนี้ต้องการ GPU แทบจะบังคับ
💡 เกณฑ์ตัดสินง่าย ๆ ข้อเดียว: ถ้ามีคนนั่งจ้องหน้าจอรอคำตอบอยู่ และมีมากกว่าหนึ่งคน อย่าใช้เส้นทางนี้ แต่ถ้าเป็นงานที่ระบบทำเองเงียบ ๆ แล้วส่งผลไปเก็บไว้ นี่คือจุดที่มันคุ้มจริง

ภาพรวมการติดตั้ง Ollama บน VPS

การติดตั้งไม่ซับซ้อน ผู้พัฒนามีสคริปต์ติดตั้งอย่างเป็นทางการสำหรับ Linux ให้อยู่แล้ว และถ้าคุณคุ้นเคยกับ Docker ก็เลือกรันในคอนเทนเนอร์ได้เช่นกัน ขั้นตอนด้านล่างเป็นภาพรวมให้เห็นว่าต้องผ่านอะไรบ้าง ไม่ใช่คู่มือแบบคัดลอกวาง เพราะรายละเอียดคำสั่งอาจเปลี่ยนตามเวอร์ชัน ให้ยึดตามเอกสารทางการเป็นหลักเสมอ

  1. 1เลือกแพ็กเกจให้แรมพอกับโมเดลที่ตั้งใจใช้ก่อน โดยดูจากตารางแรมด้านบน แล้วเผื่อพื้นที่ดิสก์สำหรับไฟล์โมเดลด้วย
  2. 2เตรียมเครื่อง Linux ให้พร้อม อัปเดตแพ็กเกจของระบบให้เป็นปัจจุบัน และสร้างผู้ใช้ทั่วไปสำหรับทำงานแทนการใช้บัญชี root ตลอดเวลา
  3. 3ตั้งไฟร์วอลล์ให้เปิดเฉพาะพอร์ตที่จำเป็นตั้งแต่ต้น อย่างน้อยคือพอร์ตสำหรับเข้าใช้งานระยะไกล และปิดพอร์ตอื่นไว้ก่อน
  4. 4ติดตั้ง Ollama ด้วยสคริปต์ติดตั้งอย่างเป็นทางการจากเว็บไซต์ผู้พัฒนา หรือเลือกใช้อิมเมจคอนเทนเนอร์ถ้าเครื่องคุณจัดการทุกอย่างด้วย Docker อยู่แล้ว
  5. 5ตั้งให้ Ollama ทำงานเป็นบริการของระบบ เพื่อให้กลับมาทำงานเองหลังเครื่องรีสตาร์ต ตัวติดตั้งบน Linux จะจัดการส่วนนี้ให้อยู่แล้วในกรณีทั่วไป
  6. 6ดาวน์โหลดโมเดลด้วยคำสั่ง ollama pull ตามด้วยชื่อโมเดล แนะนำให้เริ่มจากโมเดลเล็กที่สุดที่ยอมรับคุณภาพได้ก่อน แล้วค่อยขยับขึ้นถ้าเครื่องยังไหว
  7. 7ทดสอบด้วยคำสั่ง ollama run แล้วลองถามงานจริงที่คุณตั้งใจจะใช้ พร้อมจับเวลาว่าตอบเสร็จภายในเวลาที่รับได้หรือไม่ ขั้นนี้สำคัญที่สุด เพราะเป็นตัวตัดสินว่าเส้นทางนี้เวิร์กกับคุณจริงไหม
  8. 8ถ้าจะให้โปรแกรมอื่นเรียกใช้ ให้เชื่อมผ่านเครือข่ายภายในเครื่องหรือเครือข่ายส่วนตัวเท่านั้น และอ่านหัวข้อความปลอดภัยถัดไปก่อนเปิดให้เข้าถึงจากภายนอก
  9. 9เฝ้าดูการใช้แรมและพื้นที่ดิสก์ในช่วงสัปดาห์แรก เพราะไฟล์โมเดลที่ทดลองไว้หลายตัวมักกินดิสก์เกินที่คาดไว้
💡 อย่าลืมว่าโมเดลที่โหลดค้างไว้ในแรมจะกินแรมอยู่ตลอดช่วงหนึ่งหลังใช้งาน ถ้าเครื่องเดียวกันรันบริการอื่นอยู่ด้วย ควรวางแผนแรมเผื่อไว้ ไม่งั้นบริการอื่นอาจถูกระบบปิดทิ้งเมื่อแรมหมด

ข้อควรระวังด้านความปลอดภัย

เรื่องนี้สำคัญกว่าที่หลายคนคิด โดยค่าเริ่มต้น Ollama จะฟังอยู่ที่ 127.0.0.1 พอร์ต 11434 ซึ่งหมายถึงเฉพาะโปรแกรมบนเครื่องเดียวกันเท่านั้นที่เรียกได้ นี่เป็นค่าเริ่มต้นที่ปลอดภัยและควรเก็บไว้แบบนั้น

ปัญหาเกิดตอนที่คนอยากเรียกใช้จากเครื่องอื่น แล้วไปเปลี่ยนการผูกที่อยู่ให้รับจากทุกที่ ถ้าทำแบบนั้นบนเครื่องที่มี IP สาธารณะโดยไม่กั้นไฟร์วอลล์ เท่ากับเปิด API ให้ทั้งอินเทอร์เน็ตใช้ได้ และประเด็นสำคัญคือ Ollama ไม่ได้มีระบบยืนยันตัวตนมาให้ในตัว ใครที่ต่อถึงพอร์ตนั้นได้ก็สั่งงานโมเดล ดูรายการโมเดล หรือแม้แต่ลบโมเดลของคุณได้ ทั้งหมดนี้กินทรัพยากรเครื่องที่คุณจ่ายเงินอยู่ มีรายงานจากการสแกนทั่วอินเทอร์เน็ตว่าพบเซิร์ฟเวอร์ Ollama ที่เปิดทิ้งไว้แบบนี้เป็นจำนวนมาก ซึ่งส่วนใหญ่น่าจะไม่ได้ตั้งใจ

  • อย่าเปิดพอร์ตของ Ollama ออกสู่อินเทอร์เน็ตตรง ๆ โดยเด็ดขาด ให้คงค่าเริ่มต้นที่ฟังเฉพาะในเครื่องไว้ถ้าทำได้
  • ถ้าจำเป็นต้องเรียกจากภายนอก ให้วางตัวรับหน้าที่มีการยืนยันตัวตนไว้ข้างหน้า แล้วให้มันส่งต่อไปยัง Ollama ที่ฟังอยู่ในเครื่องอีกที ไม่ใช่เปิดพอร์ตตรง
  • จำกัดด้วยไฟร์วอลล์เสมอ อนุญาตเฉพาะที่อยู่ต้นทางที่คุณรู้จัก ไม่ใช่เปิดกว้างแล้วค่อยมาไล่ปิดทีหลัง
  • อย่าคิดว่าการที่ไม่มีใครรู้พอร์ตคือความปลอดภัย เพราะเครื่องมือสแกนหาบริการที่เปิดอยู่ทำงานตลอดเวลาและเจอได้ในไม่กี่ชั่วโมง
  • เฝ้าดูการใช้ทรัพยากรของเครื่อง ถ้า CPU ทำงานเต็มโดยที่คุณไม่ได้สั่งอะไร นั่นเป็นสัญญาณว่ามีคนอื่นกำลังใช้เครื่องคุณอยู่
  • ระวังข้อมูลที่ป้อนเข้าโมเดลเช่นกัน แม้จะประมวลผลในเครื่อง แต่บันทึกการทำงานที่เก็บไว้ก็อาจมีข้อมูลอ่อนไหวติดอยู่ ควรกำหนดสิทธิ์ไฟล์และอายุการเก็บให้เหมาะสม
💡 จำข้อเดียวก็พอ: Ollama ไม่มีระบบล็อกอินมาให้ ความปลอดภัยทั้งหมดจึงอยู่ที่การกั้นเครือข่ายของคุณเอง ถ้าไม่กั้น เท่ากับแจกเครื่องให้คนทั้งอินเทอร์เน็ตใช้ฟรี

สรุป

Ollama คือเครื่องมือที่ทำให้การรันโมเดลภาษาบนเครื่องของตัวเองกลายเป็นเรื่องที่คนทั่วไปทำได้ จุดแข็งจริง ๆ ของมันคือความเป็นส่วนตัว ต้นทุนคงที่ และการควบคุมเวอร์ชัน ไม่ใช่ความเร็ว

ถ้าจะเอาขึ้น VPS โปรดจำสองข้อนี้ไว้ให้แม่น หนึ่งคือแรมต้องพอให้โมเดลใส่ลงไปได้ก่อน สองคือแพ็กเกจของเราไม่มี GPU ความเร็วจึงเหมาะกับงานเบื้องหลังและงานเป็นชุด ไม่ใช่แชตเรียลไทม์สำหรับผู้ใช้หลายคน ถ้าคุณต้องการอย่างหลัง คุณต้องการเครื่องที่มี GPU ซึ่งเป็นคนละผลิตภัณฑ์กัน

ทางที่แนะนำคือเริ่มเล็กแล้ววัดผลจริง เช่าเครื่องแรมพอประมาณ ลองโมเดลเล็กกับงานจริงของคุณ จับเวลาดูว่ารับได้ไหม ถ้ารับได้ค่อยขยับขึ้น ถ้ารับไม่ได้ก็รู้ตั้งแต่ต้นเดือนแรกโดยเสียค่าทดลองไม่มาก ดู แพ็กเกจ VPS ทั้งหมด เพื่อเทียบแรมและราคาได้

ถ้าสนใจการ self-host เครื่องมืออื่นบนเครื่องเดียวกัน ลองอ่าน Coolify คืออะไร สำหรับการ deploy เว็บและบริการต่าง ๆ หรือ n8n สำหรับระบบ automation ที่เรียก Ollama ให้ช่วยประมวลผลข้อความในเวิร์กโฟลว์ได้

💡 บทความนี้ตั้งใจเขียนแบบไม่ขายฝัน เพราะการซื้อเครื่องด้วยความคาดหวังผิด ๆ แล้วผิดหวัง แย่กว่าการไม่ซื้อตั้งแต่แรก ถ้าไม่แน่ใจว่าโหลดงานของคุณเหมาะไหม เริ่มจากแพ็กเกจเล็กแล้วทดสอบก่อนเสมอ

อยากลองรัน LLM ของตัวเองดูสักตั้ง?

VPS ของ Plusweb มีสิทธิ์ root เต็มและ Public IPv4 ในตัว เลือกแรมให้พอกับโมเดลที่จะใช้ (ทุกแพ็กเกจเป็นเครื่อง CPU ไม่มี GPU)

คำถามที่พบบ่อย

Ollama คืออะไรแบบสั้นที่สุด?

Ollama คือโปรแกรมโอเพนซอร์สที่ใช้ดาวน์โหลดและรันโมเดลภาษาขนาดใหญ่บนเครื่องของคุณเอง ไม่ว่าจะเป็นคอมส่วนตัวหรือเซิร์ฟเวอร์ที่เช่าไว้ ตัวมันไม่ใช่โมเดล AI แต่เป็นตัวจัดการและตัวรันโมเดล พร้อมเปิดเป็น API ให้โปรแกรมอื่นเรียกใช้ได้ด้วย เผยแพร่ภายใต้สัญญาอนุญาต MIT

รัน Ollama บน VPS ที่ไม่มี GPU ได้ไหม เร็วแค่ไหน?

ได้ Ollama รองรับการทำงานบน CPU เต็มรูปแบบ แต่ต้องยอมรับว่าช้ากว่าเครื่องที่มี GPU อย่างชัดเจน คำตอบจะทยอยออกมาช้ากว่าที่คุ้นเคยจากบริการแชตออนไลน์ และยิ่งโมเดลใหญ่ยิ่งช้าลง ความเร็วจริงขึ้นกับรุ่นซีพียู ขนาดโมเดล และความยาวบทสนทนา จึงควรทดสอบกับงานของคุณเองก่อนตัดสินใจ

ต้องใช้แรมเท่าไหร่ถึงจะรันได้?

หลักคือโมเดลต้องใส่ลงในแรมได้ทั้งก้อน ถ้าใช้โมเดลที่บีบอัดระดับ 4 บิตซึ่งเป็นมาตรฐานที่นิยม จะกินพื้นที่ประมาณครึ่งกิกะไบต์เศษต่อหนึ่งพันล้านพารามิเตอร์ แล้วต้องเผื่อสำหรับบทสนทนาและระบบปฏิบัติการอีก ในทางปฏิบัติควรเริ่มที่แรม 4 GB ขึ้นไปสำหรับโมเดลเล็ก และ 8 GB ขึ้นไปถ้าจะใช้โมเดลระดับ 7–8 พันล้านพารามิเตอร์

Plusweb มีแพ็กเกจที่มี GPU ไหม?

ไม่มี แพ็กเกจ VPS ทุกตัวของเราเป็นเครื่องที่ใช้ CPU และแรมของระบบเท่านั้น ไม่มีการ์ดจอสำหรับเร่งการประมวลผล AI ดังนั้นถ้างานของคุณต้องการการประมวลผลโมเดลใหญ่แบบรวดเร็วหรือให้บริการผู้ใช้หลายคนพร้อมกัน ควรมองหาเครื่องที่มี GPU ซึ่งเป็นผลิตภัณฑ์คนละแบบกัน

งานแบบไหนที่รัน Ollama บน VPS แล้วคุ้มจริง?

งานที่ไม่มีใครนั่งรอผลแบบเรียลไทม์ เช่น สรุปหรือจัดหมวดข้อความเป็นชุดในเวลากลางคืน ดึงข้อมูลจากเอกสารภายในองค์กรที่ไม่อยากส่งออกนอก ทดลองเปรียบเทียบโมเดลก่อนลงทุนจริง หรือเป็นเครื่องยนต์เบื้องหลังให้ระบบ automation ที่ออกแบบมาให้รอผลได้ ส่วนแชตบอตหน้าเว็บที่ลูกค้าหลายคนใช้พร้อมกันไม่เหมาะกับเส้นทางนี้

เปิด API ของ Ollama ให้เข้าถึงจากอินเทอร์เน็ตได้ไหม?

ไม่ควรเปิดตรง ๆ เด็ดขาด เพราะ Ollama ไม่มีระบบยืนยันตัวตนมาให้ในตัว ใครที่ต่อถึงพอร์ตได้ก็สั่งงานโมเดลและกินทรัพยากรเครื่องคุณได้ทันที ค่าเริ่มต้นของมันคือฟังเฉพาะในเครื่องที่พอร์ต 11434 ซึ่งควรคงไว้ ถ้าจำเป็นต้องเรียกจากภายนอกจริง ให้วางตัวรับหน้าที่บังคับยืนยันตัวตนไว้ข้างหน้าแล้วส่งต่อเข้ามา พร้อมจำกัดด้วยไฟร์วอลล์เสมอ

GUIDES

บทความที่เกี่ยวข้อง

อ่านต่อในหัวข้อใกล้เคียง

ดูบทความทั้งหมด
Docker คืออะไร? อธิบายแบบเห็นภาพ พร้อมวิธีใช้จริงบน VPS
Automation & VPS

Docker คืออะไร? อธิบายแบบเห็นภาพ พร้อมวิธีใช้จริงบน VPS

Docker คือเครื่องมือที่ห่อแอปพร้อมทุกอย่างที่มันต้องใช้ไว้ในกล่องเดียว ทำให้รันที่ไหนก็ได้ผลเหมือนกัน อ่านให้เข้าใจศัพท์หลัก ความต่างจาก VM และเหตุผลที่คนเช่า VPS นิยมลง

อ่านต่อ
n8n คืออะไร? เครื่องมือ Workflow Automation ที่ต่อทุกแอปเข้าด้วยกัน
Automation & VPS

n8n คืออะไร? เครื่องมือ Workflow Automation ที่ต่อทุกแอปเข้าด้วยกัน

n8n คืออะไร ทำอะไรได้บ้าง ต่างจากเครื่องมือ automation ตัวอื่นยังไง และทำไมคนถึงเลือก self-host — อธิบายศัพท์ Node / Trigger / Workflow / Execution / Credential แบบเข้าใจง่ายตั้งแต่ศูนย์

อ่านต่อ
VPS คืออะไร? ใช้ทำอะไรได้บ้าง ฉบับเข้าใจง่าย
Cloud VPS

VPS คืออะไร? ใช้ทำอะไรได้บ้าง ฉบับเข้าใจง่าย

สรุปครบเรื่อง VPS — VPS server คืออะไร ทำงานยังไง Cloud VPS ต่างจาก VPS ทั่วไปตรงไหน ใช้ทำอะไรได้บ้าง เทียบกับ Shared Hosting และ Dedicated ใครควรใช้ และเริ่มต้นยังไงในปี 2026

อ่านต่อ