מרכז אבטחת AI
כל מה שצריך כדי להגן על מערכת LLM בייצור
אפליקציית LLM שוברת את ההנחות של אבטחת תוכנה קלאסית: הגבול אינו קוד אלא שפה, והמערכת עשויה לציית להוראה שהגיעה בתוך מסמך שהיא קראה. המרכז הזה מסדר את כל מדריכי האבטחה באתר לפי סדר הפעולות — מהבנת המפה, דרך תקיפה יזומה, ועד הגנות שמופעלות בקוד.
כל התוכן כאן הגנתי. המדריכים מיועדים להגנה על מערכות שאתה מפעיל, או לבדיקתן בהרשאה מפורשת בכתב. הם מתארים קטגוריות תקיפה כדי שתדע מפני מה להתגונן — לא מספקים מתכונים לניצול מערכות של אחרים.
למה אבטחת LLM היא תחום נפרד
שלוש הנחות יסוד של אבטחת אפליקציות פשוט לא מתקיימות כאן:
- אין הפרדה בין קוד לנתונים — הפרומפט והקלט של המשתמש מגיעים לאותו חלון הקשר. זה SQL injection מבנית, בלי parser שאפשר לתקן.
- הפגיעות אינה דטרמיניסטית — אותה בקשה נחסמת פעם אחת ועוברת בפעם הבאה. "בדקנו ותיקנו" אינו טענה שאפשר להוכיח באותו אופן.
- שטח התקיפה הוא שפה טבעית — הוא אינסופי, ורשימת חסימה לא תסגור אותו.
מכאן נגזר סדר העדיפויות שחוזר בכל המדריכים כאן: צמצום יכולת ואכיפה בקוד עדיפים תמיד על ניסוח פרומפט. פרומפט אפשר לשכנע; if user.id != row.owner_id לא.
1. המפה
התחל כאן. הטקסונומיה המקובלת של סיכוני LLM, ומה נכלל בכל אחד.
2. וקטורי התקיפה
איך תקיפות עובדות בפועל — כדי לדעת מפני מה אתה מגן.
3. בדיקה יזומה
איך בודקים באופן שיטתי, חוזר וניתן למדידה — עם כלים וקוד.
4. הגנות
מה מיישמים בפועל — ובאיזה סדר, מהעמיד לשביר.
5. AI בצד המגן
שימוש ב-AI ככלי הגנה, לא רק כמשטח שצריך להגן עליו.
6. פרטיות נתונים
כשהנתונים אינם רשאים לצאת — ההגנה החזקה ביותר היא שהם לא יוצאים.
מסלול מומלץ לפי תפקיד
מפתח שבונה פיצ'ר LLM ראשון
OWASP LLM Top 10 → Prompt Injection → Guardrails → פלט מובנה
מי שמפעיל סוכן עם כלים בייצור
אבטחת סוכנים → Prompt Injection (הזרקה עקיפה) → Red Teaming
איש אבטחה שנכנס לתחום
OWASP LLM Top 10 → Jailbreak → Red Teaming → מודיעין איומים
ארגון עם נתונים רגישים
הרצה מקומית → אבטחת סוכנים → Guardrails
העיקרון החוזר
אם תיקח דבר אחד מכל המרכז הזה, שיהיה סדר העדיפויות בהגנה — מהעמיד ביותר לשביר ביותר:
1. צמצום יכולת הסר הרשאה שהסוכן לא צריך.
פגיעות בכלי שאינו קיים אינה ניתנת לניצול.
2. אכיפה בקוד הרשאות ובדיקות מחוץ למודל.
המודל יכול להשתכנע; תנאי בקוד לא.
3. סינון פלט חסימת דפוסים רגישים לפני שהתשובה יוצאת.
4. חיזוק הפרומפט עוזר, אך השכבה הקלה ביותר לעקיפה.
לעולם לא לבד.