MODELNEW

איך להריץ LLM על מחשב ביתי בלי לתקוע אותו

מודל שפה גדול מדי הוא הסיבה הכי נפוצה שמחשב ביתי קופא בניסיון הראשון. איך בוחרים גודל מודל שמתאים לחומרה שיש לכם בפועל, ולא לחומרה שהייתם רוצים שתהיה.

מערכת בינה AI טופמודלים16 בספטמבר 20263 min2 sources
מחשב ביתי כהה עם כרטיס מסך זוהר וגרף שימוש בזיכרון על המסך
מחשב ביתי כהה עם כרטיס מסך זוהר וגרף שימוש בזיכרון על המסך

מישהו מתקין Ollama, רואה רשימת מודלים ובוחר את הגדול ביותר - למה להתפשר, נכון? חצי שעה אחר כך המחשב קפוא לגמרי, הכונן התמלא בעשרות גיגה, וההודעה הראשונה שהמודל החזיר לקחה חמש דקות. הבעיה לא בכלי - היא בבחירת מודל שלא מתאים בכלל לחומרה שיושבת מתחת לשולחן.

מה קורה בפועל כשהמודל גדול מדי

כלל אצבע פשוט: בכימות Q4 (הפורמט הנפוץ להרצה ביתית) כל מיליארד פרמטרים שווה בערך 0.6GB זיכרון. מודל של 70B, שנשמע כמו "הכי חכם אז הכי טוב", דורש כ-40GB - הרבה מעבר למה שיש כמעט בכל מחשב ביתי. כשהזיכרון לא מספיק, המערכת לא פשוט מסרבת: היא מתחילה להחליף חלקים מהמודל לדיסק (swap), וכל טוקן שנוצר עובר דרך הכונן הקשיח במקום הזיכרון - זו הסיבה למחשב שקופא ולתשובה שלוקחת דקות.

שווה לזכור גם שהבעיה לא רק בזיכרון בזמן ריצה - קובץ המודל עצמו יושב על הדיסק. מודל 70B בכימות Q4 תופס כ-40GB שטח פנוי, לפני שבכלל טענתם אותו לזיכרון. על לפטופ עם SSD של 256GB זו לבד סיבה מספיקה לבחור מודל קטן יותר, גם אם איכשהו היה מצליח לרוץ.

שלב ראשון: לבדוק מה באמת יש במחשב

לפני שמורידים מודל, שני מספרים קובעים הכל:

  • זיכרון מערכת (RAM) - ב-Windows: הגדרות > מערכת > אודות. ב-Mac: תפריח אפל > About This Mac.
  • VRAM של כרטיס המסך, אם יש - ב-Windows: מנהל המשימות > ביצועים > GPU. במחשבי Apple Silicon (M1 ומעלה) אין הפרדה - כל הזיכרון המאוחד זמין גם למודל.

התאמה נכונה בין החומרה למודל

חומרה ביתית טיפוסיתמודל שמתאיםכלי מומלץ
לפטופ בלי כרטיס מסך נפרד, 16GB RAMLlama 3.2 3B / Phi-4 Mini (Q4)GPT4All - התקנה יחידה, בלי טרמינל
מחשב עם כרטיס מסך 8GB (למשל RTX 4060)Llama 3.1 8B / Qwen3 8B (Q4_K_M)LM Studio או Ollama
Mac עם Apple Silicon, 16GB+ זיכרון מאוחדמודל 8B בנוחות, 14B בדוחקLM Studio

הנתונים לפי טבלת הדרישות המעודכנת: מודל 7-8B צריך 5-9GB, ו-14B כבר קרוב ל-9GB זיכרון ייעודי. מבחינת כלי ההרצה - GPT4All מתאים למי שרוצה להתחיל בלי טרמינל בכלל, ו-LM Studio נותן ממשק גרפי מלא עם דפדפן מודלים מובנה.

דוגמה קונקרטית: לפטופ בלי כרטיס מסך, מודל ראשון שרץ חלק

לפטופ על שולחן ביתי בערב, מסך זוהר בעמימות עם שיחה מטושטשת, אור מנורה חם לצד זוהר סגול קריר

  1. מורידים את GPT4All (macOS/Windows/Linux, מתקין יחיד).
  2. בתפריט המודלים בוחרים Llama 3.2 3B Instruct בכימות Q4 - גודל הורדה של כ-2GB.
  3. פותחים שיחה. על 16GB RAM בלי כרטיס מסך נפרד הקצב סביר לשיחה רגילה, גם אם לא מיידי כמו שירות ענן.
  4. אם התגובה איטית מדי בפועל - הצעד הבא הוא לא "לסבול", אלא לעבור למודל קטן יותר (Phi-4 Mini) לפני שמוותרים על הרצה מקומית לגמרי.
התאמת חומרה ביתית לגודל מודל לפטופ בלי GPU 16GB RAM GPU ביתי 8GB RTX 4060 לדוגמה Mac Apple Silicon 16GB+ מאוחד 3B-4B Q4 GPT4All 7B-8B Q4_K_M LM Studio / Ollama 8B נוח, 14B בדוחק LM Studio כלל אצבע: כל מיליארד פרמטרים ב-Q4 שווה כ-0.6GB זיכרון
איזה גודל מודל מתאים לאיזה מחשב ביתי, לפי כימות Q4

מה נהוג לחשוב בטעות

"צריך כרטיס מסך יקר כדי בכלל להתחיל" - לא נכון. מודל קטן רץ סביר על מעבד בלבד, וזו הדרך הטובה ביותר להבין אם הרצה מקומית שווה לכם בכלל לפני שמשקיעים בחומרה.

"אם המודל נטען בהצלחה, זה אומר שהוא מהיר מספיק" - טעינה מוצלחת ומהירות שמישה הן שתי שאלות נפרדות. מודל 8B שרץ על מעבד בלבד נע סביב 12 טוקנים לשנייה, לעומת 70 ומעלה על כרטיס מסך ייעודי כמו RTX 3060 - שניהם "עובדים", אבל רק אחד מהם נעים לשיחה שוטפת.

מה לנסות עכשיו

בדקו RAM ו-VRAM לפי השלב הראשון למעלה, התקינו GPT4All והורידו מודל אחד קטן מהטבלה. אם זה עובד חלק ואתם רוצים יותר שליטה או מודלים גדולים יותר - השלב הבא הוא להתקין את Ollama ולעבור לניהול מודלים מהטרמינל, אחרי שכבר ראיתם מה בכלל כרוך בהרצה מקומית.

שאלות נפוצות

אפשר להריץ LLM בבית בלי כרטיס מסך נפרד בכלל?

כן - מודל קטן כמו Llama 3.2 3B או Phi-4 Mini רץ על מעבד בלבד עם 16GB זיכרון מערכת, בקצב של בערך 12-25 טוקנים לשנייה לפי המעבד. איטי יותר מכרטיס מסך, אבל שמיש לגמרי לשיחה או לניסוח טקסט.

איך יודעים כמה VRAM יש למחשב בפועל?

ב-Windows: מנהל המשימות > ביצועים > GPU, השורה 'Dedicated GPU memory'. ב-Mac עם Apple Silicon אין VRAM נפרד - הזיכרון המאוחד (Unified Memory) שמופיע ב'About This Mac' משמש גם למודל וגם למערכת.

SOURCES

  1. Local LLM Hardware Requirements (2026) - PromptQuorum · נבדק 16 בספטמבר 2026
  2. Ollama vs LM Studio vs Jan vs GPT4All: 2026 Guide - PromptQuorum · נבדק 16 בספטמבר 2026

קשור לזה