מעודכן ליולי 2026 14 דקות קריאה מתקדם

RAG מתקדם
— מ"בערך" למדויק

RAG בסיסי (embed → חפש → הדבק) עובד בהדגמה ונכשל בפרודקשן: מחזיר קטעים לא רלוונטיים, מפספס תשובות קיימות, וגורם להזיות. במדריך: chunking חכם, hybrid search, reranking, metadata filtering ו-GraphRAG — הטכניקות שהופכות אחזור "בערך" למערכת מדויקת שאפשר לסמוך עליה.

Hybrid
מילים + משמעות
Rerank
דיוק אחרי אחזור
GraphRAG
קשרים בין ישויות

למה RAG בסיסי נכשל בפרודקשן

אם קראת את מדריך ה-RAG הבסיסי, אתה מכיר את הזרימה: מפצלים מסמכים ל-chunks, ממירים ל-embeddings, שומרים ב-vector DB, ובזמן שאלה מחפשים את ה-chunks הדומים ומדביקים לפרומפט. זה עובד — עד שזה לא.

שלוש בעיות שוברות RAG בסיסי ברגע שהדאטה אמיתי:

כל טכניקה במדריך הזה מטפלת ישירות באחת מהבעיות. נעבור לפי סדר הזרימה.

Chunking חכם — הבסיס שקובע הכל

איכות ה-chunking קובעת את תקרת האיכות של כל המערכת. chunk טוב הוא יחידת מידע קוהרנטית שאפשר להבין בפני עצמה. אסטרטגיות מעבר לפיצול-לפי-אורך הנאיבי:

Hybrid Search — הכי משתלם ליחידת מאמץ

זה השדרוג עם ההחזר הכי טוב, והוא פשוט יחסית. Hybrid search משלב שני סוגי חיפוש ומאחד את התוצאות:

psychology
חיפוש וקטורי (סמנטי)
תופס משמעות ופרפרזה. "איך מבטלים מנוי" ימצא גם "הפסקת שירות". חלש במונחים מדויקים.
manage_search
חיפוש מילולי (BM25)
תופס מונחים מדויקים: מספרי קטלוג, שמות, קודי שגיאה. חלש בפרפרזה ובמשמעות.

משלבים את שניהם ומאחדים את הדירוגים (בד"כ בשיטה כמו RRF — Reciprocal Rank Fusion). התוצאה תופסת גם משמעות וגם מונחים מדויקים — כיסוי שאף שיטה לבדה לא נותנת. רוב ה-vector DBs המודרניים תומכים ב-hybrid search מובנה.

Reranking — שלב הדיוק

אחזור מהיר (וקטורי/BM25) הוא "רשת רחבה" — הוא מביא מהר הרבה מועמדים, אבל הדירוג שלו גס. Reranker הוא מודל ייעודי (cross-encoder) שקורא את השאלה ואת כל מועמד ביחד ונותן ציון רלוונטיות מדויק בהרבה.

הדפוס המנצח הוא שני שלבים:

1
אחזור רחב
הבא מהר ~50 מועמדים ב-hybrid search. עדיף recall גבוה — שהתשובה תהיה איפשהו בפנים.
2
Rerank וסינון
העבר את ה-50 דרך reranker, קח את ה-5 הכי טובים בלבד ל-LLM. הדיוק קופץ, וההקשר נשאר קצר וזול.
tips_and_updates
reranking גם חוסך כסף

כשה-5 chunks שמגיעים ל-LLM באמת רלוונטיים, אפשר לשלוח פחות הקשר — פחות טוקנים, תשובה טובה יותר. reranking משפר איכות ומוריד עלות באותו זמן.

GraphRAG ו-metadata filtering

Metadata filtering

זכור את ה-metadata שצירפנו ב-chunking? עכשיו הוא משתלם. במקום לחפש בכל המאגר, סנן קודם: "רק מסמכים מ-2026", "רק מהמחלקה הזו", "רק מדריכי מוצר". זה מקטין את מרחב החיפוש, מעלה דיוק, ומונע החזרת מידע מיושן או לא-רלוונטי.

GraphRAG

חיפוש רגיל מוצא chunks בודדים ומבודדים. GraphRAG בונה גרף ידע — ישויות (אנשים, מוצרים, מושגים) והקשרים ביניהן — ומאפשר לענות על שאלות ש"מחברות נקודות" בין מסמכים. שאלה כמו "אילו לקוחות מושפעים מהשינוי במדיניות X?" דורשת לחבר מידע ממקורות שונים — משהו שחיפוש דמיון בודד לא עושה טוב. GraphRAG יקר יותר לבנות, אז שמור אותו למקרים שבאמת דורשים חשיבה על קשרים.

הפייפליין המלא — איך הכל מתחבר

1 Chunking חכם + העשרת metadata + contextual retrieval.
2 Metadata filter — צמצם את מרחב החיפוש לפני האחזור.
3 Hybrid search — הבא ~50 מועמדים (וקטורי + BM25).
4 Rerank — צמצם ל-5 החזקים ביותר.
5 Generate — LLM מייצר תשובה עם ציטוט מקורות.
warning
אל תוסיף הכל בבת אחת — מדוד

בנה סט הערכה (שאלות + תשובות נכונות) והוסף טכניקה אחת בכל פעם, מדוד את השיפור. בלי evals אתה מוסיף מורכבות בלי לדעת אם היא עוזרת. התחל מ-hybrid + reranking — הם נותנים את רוב השיפור.