אם אתם שומרים traces של סוכני AI למטרות ניפוי באגים או ביקורת, בדקו אותם עכשיו לאיתור מפתחות API, סיסמאות וטוקנים. חוקרי אבטחה הוכיחו שניתן לפענח חשיבה פנימית מוצפנת של מודלים ולחלץ ממנה אישורים. גם אם הספקים תיקנו את הפגיעות באוגוסט 2024, נתונים שכבר נשמרו אצלכם נשארים חשופים ודורשים סריקה ידנית או מחיקה.
חוקרי אבטחה גילו פגיעות ב-API של OpenAI, Anthropic וGoogle שאפשרה לפענח חשיבה פנימית מוצפנת של מודלים מתקדמים באמצעות מודלים חלשים יותר. מתוך 6,708 מסלולי סוכנים ציבוריים שנבדקו, החוקרים פיענחו 315,320 בלוקי reasoning ומצאו 704 חפצי פרטיות ייחודיים: 62 מפתחות API, 33 סיסמאות, 24 טוקנים ו-7 מפתחות פרטיים. הספקים תיקנו את הבעיה באוגוסט 2024, ואין תיעוד לניצול זדוני בפועל.
איך הפגיעות עובדת ומה נחשף
מודלים מתקדמים כמו o1 של OpenAI ו-Claude 3.5 Sonnet משתמשים בחשיבה פנימית מוצפנת לפני שהם מחזירים תשובה. הפגיעות אפשרה לשלוח את החשיבה המוצפנת הזו למודל חלש יותר דרך אותו API ולקבל את התוכן המלא בטקסט פשוט. הבעיה לא הייתה בהצפנה עצמה אלא בכך שהספקים לא אכפו הפרדה בין מודלים שונים באותו חשבון.
החוקרים סרקו מסלולי סוכנים ציבוריים ומצאו מאות מפתחות API לשירותים חיצוניים, סיסמאות למסדי נתונים וטוקנים לגישה למערכות פנימיות. חלק מהמפתחות היו בתוקף במועד הגילוי. הדליפה קרתה כי סוכנים רבים שומרים traces של ריצות קודמות למטרות ניפוי באגים, ביקורת או שיפור ביצועים, והחשיבה הפנימית נשמרה יחד עם שאר הלוג.
למה זה משנה גם אחרי התיקון
הספקים תיקנו את הפגיעות באוגוסט 2024, אבל התיקון לא פותר את הבעיה למפעילי מערכות שכבר שמרו traces. נתונים שנשמרו לפני התיקון נשארים חשופים במסדי נתונים, בקבצי לוג או במערכות ניטור. מפתח API שדלף יכול לאפשר גישה למערכות ייצור, וסיסמה שנשמרה בלוג יכולה לחשוף משאבים פנימיים.
במגזר הבנקאות והפיננסי בישראל, שבו תקני אבטחה ורגולציה מחייבים תיעוד מלא של פעולות מערכות, הבעיה חריפה יותר. ארגונים שומרים traces לתקופות ארוכות לצורכי ביקורת, ולעיתים לא מיישמים סריקה אוטומטית לאיתור סודות בלוגים. הפגיעות מדגימה סיכון מבני בשימוש במודלים חיצוניים במערכות ייצור: גם אם הספק מאובטח, הנתונים שנשמרים אצלכם עלולים לחשוף אישורים.
מה לעשות השבוע
סרקו את כל ה-traces וה-logs של סוכני AI שנשמרו אצלכם לפני אוגוסט 2024. חפשו מפתחות API, סיסמאות, טוקנים ומפתחות פרטיים. אם אתם משתמשים במערכת ניטור או logging מרכזית, הריצו סריקה אוטומטית לאיתור דפוסים של אישורים. אם מצאתם אישורים שדלפו, בטלו אותם מיד והנפיקו חדשים.
אם אתם בונים מערכות AI חדשות, הימנעו משמירת traces מלאים של חשיבה פנימית למעט מקרים שבהם יש צורך רגולטורי מפורש. אם אתם חייבים לשמור, הפעילו סריקה אוטומטית לאיתור סודות לפני השמירה, ושקלו הצפנה נפרדת של logs עם מפתחות שמנוהלים מחוץ למערכת הייצור. סוכני AI לעסקים דורשים תכנון אבטחה מראש, לא רק הסתמכות על הספק.
שאלות נפוצות
בדקו את כל הלוגים ומסדי הנתונים שבהם אתם שומרים פלט של סוכני AI. חפשו מחרוזות שמתחילות ב-sk- (מפתחות OpenAI), Bearer tokens, או דפוסים של סיסמאות. אם אתם משתמשים במערכת ניטור, הריצו סריקה אוטומטית עם כלי כמו truffleHog או gitleaks.
לא. הפגיעות אפשרה לפענח חשיבה מוצפנת של מודלים מתקדמים, אבל הבעיה הרחבה יותר היא שסוכנים רבים שומרים traces עם אישורים בתוכם. גם אם אתם משתמשים במודלים פשוטים, בדקו אם הלוגים שלכם מכילים מפתחות או סיסמאות.
שיחה קצרה, בלי התחייבות, ונגיד לכם אם זה רלוונטי לעסק שלכם או לא.