מעודכן ליולי 2026 14 דקות קריאה מתקדם

Fine-Tuning של LLM
— ומתי בכלל צריך

לפני שאתה מכוונן מודל — עצור. ב-90% מהמקרים prompting טוב או RAG יפתרו את הבעיה מהר וזול יותר. אבל כשבאמת צריך התנהגות עקבית, פורמט קבוע או סגנון ייחודי — fine-tuning הוא הכלי. במדריך: מתי לכוונן ומתי לא, מה זה LoRA ו-QLoRA, איך מכינים דאטהסט, ובאילו כלים.

LoRA
כיוונון יעיל
QLoRA
על GPU אחד
Unsloth
מהיר פי 2

מה זה fine-tuning בעצם

מודל שפה מגיע מאומן מראש על כמות עצומה של טקסט — הוא "יודע" המון. Fine-tuning הוא שלב נוסף שבו אתה ממשיך לאמן את המודל על דאטהסט קטן וממוקד משלך, כדי לעצב את ההתנהגות שלו: הטון, הפורמט, הדומיין או המשימה הספציפית.

חשוב להבין את ההבחנה: fine-tuning מלמד את המודל איך להתנהג — לא מה לדעת. אם המטרה שלך היא להזין ידע עדכני או פרטי (מסמכי החברה, קטלוג מוצרים), RAG הוא הכלי הנכון, לא fine-tuning.

tune
Fine-tuning = התנהגות
טון, פורמט, סגנון, משימה קבועה. "תמיד תענה כ-JSON תקין."
menu_book
RAG = ידע
עובדות, מסמכים, מידע שמשתנה. "מה כתוב במדיניות ההחזרות שלנו?"

מתי לכוונן — ומתי ממש לא

הכלל: תמיד תתחיל מהזול והמהיר. עלה בסולם רק כשהשלב הקודם לא הספיק.

1
Prompting חכם
הוראות טובות + דוגמאות (few-shot). פותר את רוב הבעיות. חינם ומיידי.
2
RAG
צריך ידע חיצוני/עדכני/פרטי? חבר vector DB. עדיין בלי אימון.
3
Fine-tuning
רק כשצריך התנהגות עקבית שקשה להשיג בפרומפט, פורמט קשיח, או להקטין מודל גדול למודל קטן וזול שעושה משימה אחת מצוין.
check_circle
מתי fine-tuning באמת מנצח

כשיש לך משימה חוזרת וברורה עם מאות-אלפי דוגמאות איכותיות; כשאתה רוצה מודל קטן ומקומי (7B) שיתנהג כמו מודל גדול במשימה צרה; או כשהפרומפט נהיה ארוך ויקר וכל בקשה משלמת עליו. אז כיוונון חוסך טוקנים וכסף לאורך זמן.

warning
אל תכוונן כדי "ללמד עובדות"

הטעות הכי נפוצה. fine-tuning על עובדות גורם להזיות (המודל "משלים" מה שלא זכר) ומתיישן ברגע שהמידע משתנה. לידע — תמיד RAG.

LoRA ו-QLoRA — כיוונון בלי חומרה של ענק

אימון מלא (full fine-tuning) של כל משקלי המודל דורש חומרה יקרה מאוד. LoRA (Low-Rank Adaptation) פותר את זה: במקום לעדכן את כל המשקולות, מקפיאים את המודל המקורי ומאמנים רק שכבות מתאם קטנות (adapters). התוצאה — פחות מ-1% מהפרמטרים באימון, אך איכות קרובה מאוד לאימון מלא.

QLoRA מוסיף קוונטיזציה: טוענים את המודל הבסיסי ב-4-bit ומאמנים מעליו את ה-adapters. כך אפשר לכוונן מודל 7B–13B על GPU יחיד (אפילו כרטיס צרכני עם 16–24GB). זו הסיבה שכיוונון הפך נגיש לכולם.

שיטה זיכרון GPU מתי
Full fine-tuneגבוה מאודמעט מאוד מקרים
LoRAבינוניברירת מחדל טובה
QLoRAנמוך (GPU יחיד)תקציב/חומרה מוגבלת

הכנת דאטהסט — כאן ההצלחה נקבעת

90% מההצלחה של fine-tuning היא איכות הדאטה, לא ההיפר-פרמטרים. דאטהסט קטן ונקי מנצח דאטהסט גדול ומלוכלך כל יום.

הפורמט הנפוץ הוא שיחות בסגנון chat — כל דוגמה היא זוג של קלט ופלט רצוי:

{"messages": [
  {"role": "system", "content": "אתה נציג שירות מנומס של חברת X."},
  {"role": "user", "content": "איך מחזירים מוצר?"},
  {"role": "assistant", "content": "בשמחה! ההחזרה פשוטה..."}
]}

כלים ותהליך — איך מכוונים בפועל

התהליך הטיפוסי: הכנת דאטהסט → בחירת מודל בסיס (למשל Llama/Qwen/Mistral) → אימון LoRA/QLoRA → הערכה מול validation → מיזוג ה-adapter או הרצתו מעל המודל → פריסה (למשל דרך Ollama מקומית).

טיפים ומלכודות נפוצות

lightbulb
התבנית שעובדת ב-2026

רוב המערכות המנצחות לא מכווננות בכלל, או משלבות: RAG לידע + fine-tuning קל להתנהגות. RAG מביא את העובדות העדכניות, וכיוונון קטן מלטש את הטון והפורמט. תתחיל מ-RAG (מדריך RAG), ושקול כיוונון רק כשההתנהגות עדיין לא במקום.