בינה מלאכותית מול ההאקרים
בינה מלאכותית מול ההאקריםצילום: איסטוק

האם בינה מלאכותית יכולה להחליף חלק מעבודתו של חוקר אבטחה? ניסוי שנערך באמצעות מספר מודלי AI מצביע על כך שהתשובה עשויה להיות חיובית - לפחות בחלק מהמקרים.

בתוך שעות ספורות הצליחו המודלים לאתר חולשות אבטחה, לאמת חלק מהממצאים ולהציע תיקונים, בעלות כוללת של ארבעה דולרים בלבד.

הרעיון לניסוי נולד לאחר קריאת מאמר מקצועי שעסק באיתור פרצת אבטחה במערכת WordPress. בעקבותיו נוסח Prompt דומה, שהותאם לבדיקת מערכת אחרת, ונשלח תחילה ל-GPT 5.6 Sol. המודל סירב לבצע את המשימה, ולכן הוחלט להעביר אותה למודל GLM 5.2.

כדי להימנע משליחת קוד המקור לשרתים בסין, הופעל GLM דרך חברת MoonMath הישראלית, במקביל להרצת DeepSeek על חומרה מקומית. בעוד GLM פעל דרך שירות ענן, DeepSeek רץ באופן מקומי, במחיר של צריכת חשמל גבוהה וביצועים איטיים משמעותית.

כבר בתוך דקות ספורות הצליח GLM לזהות ממצא שהתברר כלא פרצת אבטחה אמיתית, אך בסביבת הפיתוח התנהג ככזו. זמן קצר לאחר מכן הוא איתר את מפתח ה-JWT של סביבת הפיתוח, ובהמשך זיהה חולשת אבטחה במימוש ייחודי של FFMpeg, שאפשרה לקרוא קבצים ממערכת הקבצים בתנאי הסביבה שבה בוצעה הבדיקה.

לאחר שהחולשה אומתה, המודל התבקש גם להציע תיקון, וזה יושם ונבדק בהצלחה. בהמשך זוהתה גם חולשת IP Spoofing, שנבעה מכך שהמודל לא הכיר את ארכיטקטורת הרשת, הפועלת מאחורי CDN. לאחר שסופק לו מידע נוסף על סביבת ההפעלה, הוא הציע תיקון מתאים גם לממצא זה.

במהלך הסריקה המשיך GLM לבדוק אזורים שונים בקוד, להריץ קוד אמיתי ולנסות לנצל בפועל חולשות שחשד בקיומן לפני שהציג אותן כממצאים. חלק מהחשדות הופרכו במהלך הבדיקה, ואחרים הסתיימו בהמלצות לשיפורים שאינם מוגדרים כחולשות קריטיות, אך עשויים לחזק את אבטחת המערכת.

לאחר כשלוש שעות הושלמה הבדיקה באמצעות GLM, ולאחר מכן הופנה אותו Prompt גם ל-DeepSeek. הממצאים היו דומים בחלקם, אך כללו גם רעיונות שונים. בניגוד ל-GLM, שניסה להוכיח בפועל שניתן לנצל את החולשות שמצא, DeepSeek הסתפק בעיקר בהפקת דוח מפורט על נקודות התורפה והשלכותיהן התאורטיות.

בהמשך התבקש DeepSeek לנסות לנצל את החולשות שמצא, אך בחר בגישה אחרת: יצירת קובץ תמונה פגום שנועד לבחון את ממשק ה-API. לאחר מכן הועברו הממצאים למודל Qwen, שרץ מקומית במהירות גבוהה יותר. הוא המשיך לבחון כיווני תקיפה נוספים, ובהם ניסיון לאתר חולשת SQL Injection, אך בסופו של דבר נתקע בלולאה אינסופית והבדיקה הופסקה.

בסיכום הניסוי הוערך כי בעלות של ארבעה דולרים וצריכת חשמל של מספר שעות התקבלה בדיקת אבטחה מקיפה, שלדברי עורך הניסוי הייתה עשויה לעלות אלפי דולרים בבדיקת חדירה מסורתית. לצד איתור החולשות, המודלים שסיפקו ממצאים הציעו גם תיקונים, שיושמו ונבדקו במהלך העבודה.