Vector DB — הזיכרון
של RAG וסוכני AI
כל מערכת RAG וכל סוכן עם זיכרון ארוך-טווח נשען על מסד נתונים וקטורי — המקום שבו נשמר "הידע" כווקטורים ונשלף לפי דמיון משמעות. במדריך: איך זה עובד באמת, השוואה בין Pinecone, Qdrant, Weaviate ו-pgvector, ואיך לבחור את הנכון לפרויקט שלך.
מה זה מסד נתונים וקטורי ולמה צריך אותו
מסד נתונים רגיל מחפש התאמה מדויקת: "תן לי את כל הרשומות שבהן city = תל אביב". מסד נתונים וקטורי מחפש דמיון משמעות: "תן לי את המסמכים הכי קרובים במשמעות לשאלה הזו". זה בדיוק מה שצריך ל-RAG ולזיכרון של סוכנים — למצוא ידע רלוונטי גם כשלא נכתב באותן מילים.
הקסם עובד דרך embeddings: מודל הופך כל קטע טקסט לווקטור של מספרים (רשימה של, נניח, 1536 ערכים) שמייצג את המשמעות. טקסטים דומים במשמעות מקבלים ווקטורים קרובים במרחב. ה-vector DB שומר את הווקטורים האלה ויודע לשלוף במהירות את הקרובים ביותר לשאילתה.
איך חיפוש דמיון עובד — בקצרה
התהליך מתחלק לשני שלבים: הזנה (indexing) ו-שליפה (query).
חיפוש הווקטור הכי קרוב באופן מדויק בין מיליון ווקטורים איטי מדי. HNSW (Hierarchical Navigable Small World) בונה גרף שכבתי שמאפשר למצוא את השכנים הקרובים בקירוב במהירות עצומה, עם דיוק של 95%+. כמעט כל vector DB מודרני משתמש בו.
טבלת השוואה — במבט אחד
| מסד | מודל | הכי טוב ל |
|---|---|---|
| Pinecone | מנוהל בלבד | הקמה מהירה בלי DevOps |
| Qdrant | קוד פתוח + ענן | ביצועים ו-self-host |
| Weaviate | קוד פתוח + ענן | Hybrid search ומודולים |
| pgvector | תוסף ל-Postgres | כבר יש לך Postgres |
| Chroma | קוד פתוח, embedded | פרוטוטייפ ולמידה |
הכלים המובילים — למי מתאים כל אחד
- Pinecone — שירות מנוהל לחלוטין. אתה לא מנהל שרת, זה פשוט עובד ומתרחב. המחיר על הנוחות. מצוין להתחלה מהירה ולפרודקשן בלי צוות DevOps. ראה את מדריך Pinecone המלא.
- Qdrant — כתוב ב-Rust, מוביל בביצועים ובמהירות, עם payload filtering עשיר. קוד פתוח ל-self-host או ענן מנוהל. הבחירה של הרבה סוכני AI ב-2026.
- Weaviate — חזק ב-Hybrid Search (וקטורי + מילות מפתח יחד) ובמודולים מובנים ל-embedding. קוד פתוח + ענן.
- pgvector — תוסף ל-PostgreSQL. אם כבר יש לך Postgres — אתה מקבל חיפוש וקטורי בלי להוסיף מערכת חדשה. גם Supabase בנוי על זה. אידיאלי לפרויקטים בינוניים.
- Chroma — קל משקל, רץ embedded בתוך האפליקציה. מושלם לפרוטוטייפ, למידה ופרויקטים קטנים מקומיים.
איך לבחור — עץ החלטה
טיפים לאיכות שליפה
- Chunking נכון — קטעים לא גדולים מדי (מאבדים דיוק) ולא קטנים מדי (מאבדים הקשר). התחל מ-300–800 טוקנים עם overlap קטן, וכוונן לפי התוצאות.
- Metadata filtering — שמור metadata (מקור, תאריך, קטגוריה) וסנן לפיו לפני החיפוש הווקטורי. מצמצם רעש ומשפר רלוונטיות דרמטית.
- Hybrid Search — שילוב חיפוש וקטורי עם חיפוש מילות מפתח (BM25) תופס גם מונחים מדויקים וגם משמעות. Weaviate ו-Qdrant תומכים בזה מובנה.
- Reranking — אחרי שליפה ראשונית, מדרג מחדש את התוצאות עם מודל reranker (Cohere, Jina) לדיוק גבוה יותר בטופ.
- אותו מודל embedding — הקפד להשתמש באותו מודל להזנה ולשליפה. ערבוב מודלים = תוצאות אקראיות.
איכות RAG נקבעת הרבה יותר על ידי chunking, בחירת מודל ה-embedding ו-reranking — פחות על ידי איזה vector DB בחרת. כמעט כל הכלים משתמשים באותו HNSW ונותנים תוצאות דומות. תתחיל פשוט (pgvector/Chroma), ושדרג רק כשקנה המידה מחייב. ראה את מדריך ה-RAG המלא.