מעודכן ליולי 2026 13 דקות קריאה מתקדם

Guardrails ל-AI
— לשלוט במה שהמערכת עושה

מודל שפה הוא לא-דטרמיניסטי: אותה מערכת יכולה לענות מצוין ורגע אחר כך לחשוף PII, להזות עובדה, או להיגרר להוראה זדונית. Guardrails הם שכבות ההגנה שמקיפות את המודל — סינון קלט ופלט, זיהוי PII, מניעת הזיות ו-human-in-the-loop — כדי שתוכל להעלות AI לפרודקשן ולישון בלילה.

קלט
לפני המודל
פלט
אחרי המודל
אנוש
בפעולות רגישות

מה זה guardrails ולמה זה לא אופציונלי

Guardrails הם בקרות דטרמיניסטיות שעוטפות את המודל הלא-דטרמיניסטי. הרעיון המרכזי: אל תסמוך על המודל לשמור על עצמו. גם מודל מצוין יטעה מדי פעם — התפקיד של ה-guardrails הוא לתפוס את הטעות לפני שהיא מגיעה למשתמש או גורמת נזק.

המבנה הבסיסי הוא שלוש שכבות סביב כל קריאה למודל:

login
1. Input guardrails — לפני המודל
בודקים את מה שנכנס: תוכן פוגעני, ניסיונות jailbreak/injection, PII, נושאים מחוץ לתחום.
logout
2. Output guardrails — אחרי המודל
בודקים את מה שיוצא: הזיות, חשיפת PII, טון לא ראוי, פורמט שגוי, תוכן מחוץ למדיניות.
supervisor_account
3. Human-in-the-loop — בפעולות רגישות
פעולות שמשנות מצב (שליחה, מחיקה, תשלום) עוברות אישור אנושי לפני ביצוע.

סינון קלט — עצירת בעיות לפני שהן מתחילות

הבדיקות שכדאי להריץ על כל קלט לפני שהוא מגיע למודל:

סינון פלט — הבדיקה שהכי חשוב לא לדלג עליה

זו השכבה שרוב האנשים שוכחים, והיא הקריטית ביותר — כי כאן נתפסות הבעיות שהמשתמש היה רואה בפועל:

psychology_alt
LLM-as-judge כ-guardrail

טכניקה חזקה: השתמש במודל שני (זול/מהיר) כ"שופט" שבודק את הפלט של המודל הראשון מול מדיניות — "האם התשובה הזו חושפת PII? האם היא נתמכת במקורות?". שכבת בדיקה אוטומטית שתופסת הרבה, בעלות נמוכה.

Human-in-the-loop — לפעולות שאי אפשר להחזיר

guardrails אוטומטיים תופסים הרבה, אבל לפעולות עם השלכות אמיתיות צריך אדם בלולאה. הכלל: ככל שהפעולה יותר בלתי-הפיכה, כך נדרש יותר פיקוח אנושי.

סוג פעולה רמת פיקוח
קריאה בלבד (חיפוש, סיכום)אוטומטי
שינוי הפיך (טיוטה, תיוג)אוטומטי + לוג
שליחה/פרסום חיצוניאישור אנושי
מחיקה/תשלום/כספיםאישור אנושי מפורש

עצב את הסוכן כך שפעולות רגישות עוצרות ומחכות לאישור, במקום לרוץ אוטומטית. זו גם דרישה מרכזית באבטחת סוכנים.

כלים ותבנית מעשית

architecture
התבנית: fail closed, ולוג הכל

כשguardrail לא בטוח — חסום, אל תעביר (fail closed). עדיף להחזיר "לא יכול לעזור בזה" מאשר לתת תשובה מזיקה. ותעד כל חסימה: מה נחסם, איזה guardrail, ומתי — כדי לכייל ולשפר.

צ'קליסט לפני פרודקשן

check_circle סינון קלט — PII, jailbreak, תוכן פוגעני, off-topic.
check_circle סינון פלט — grounding, PII, מדיניות, ולידציית פורמט.
check_circle Human-in-the-loop על כל פעולה בלתי-הפיכה.
check_circle Fail closed — בספק, חסום.
check_circle לוג ומעקב על כל הפעלת guardrail.
balance
האיזון: בטיחות מול חוויית משתמש

guardrails אגרסיביים מדי יחסמו קלט לגיטימי (false positives) ויתסכלו משתמשים. guardrails רפויים מדי יפספסו בעיות. אין הגדרה "נכונה" אחת — מדוד את שיעור החסימות והתלונות, וכייל לאורך זמן לפי הסיכון של המערכת שלך.