GPT
A

AX-RAY

קוד פתוח

FINAL-Benchcc-by-nc-4.02026-08-14

  • ai-safety
  • ax-safety
  • ai-evaluation
  • model-evaluation
  • model-audit

אפשר גם להריץ אותו בדפדפן בלי להתקין דבר.

קטלוג מובנה של 117 קריטריוני אבחון לבטיחות בינה מלאכותית ומוכנות לפריסה מבצעית. הוא מגדיר מה לבדוק ואיזה ראיות לאסוף במקום לתת ציונים מוכנים או מבחנים לפרומפטים.

  • 1,452הורדות בחודש
  • 47לייקים

מה זה

המאגר מכיל בדיוק 117 רשומות המייצגות קריטריונים להערכה, ולא שאלות או תשובות מודל. הרשומות מחולקות לשני צירים: 89 שייכות לציר MODEL-SCAN לבחינת המודל עצמו, ו־28 שייכות לציר AX-SCAN לתשתיות, פריסה וציות. הנתונים מאורגנים תחת 11 קטגוריות שכוללות אמינות, חוסן, דליפה סיבתית, אבטחת תשתית ורגולציה.

מקור התוכן הוא שדות מקוריים בקוריאנית שעברו עיבוד לשכבה טכנית באנגלית. כל רשומה כוללת מזהה קבוע, שאלת הערכה, רמת חומרה, סוג הראיה הנדרשת לבדיקה, והפניות לרגולציה בשבע טריטוריות. 98 רשומות כוללות תקציר משפטי, וב־19 צוין מפורשות שאין תקציר כזה.

מתאים ל

  • בניית מבדקי בטיחות לפריסה

    הגדרת רשימת תיוג ודרישות סף הנדסיות לפני העלאת מודל שפה לסביבת ייצור.

  • מיפוי פערי רגולציה

    הצלבת בקרות המערכת שלכם מול שדות הציות והחוק בשבע הטריטוריות שממופות בקטלוג.

  • ביקורת ואיסוף ראיות

    קביעת סוג המסמכים והמדידות הטכניות שצוות הפיתוח נדרש לספק עבור כל סיכון בטיחותי.

איפה זה נופל

זה לא מאגר לאימון מודלים ואין בו פרומפטים, משקולות ציון או ספי החלטה. עברית לא קיימת פה כלל, השפות היחידות הן אנגלית וקוריאנית. החיסרון המשמעותי ביותר שהיוצרים מודים בו הוא רמת האימות: נכון לגרסה זו, אפס מתוך 117 הציטוטים והמקורות המשפטיים עברו בדיקה ואימות ידני מלא מול המקור הראשוני. בנוסף, רמות החומרה הן תוויות סובייקטיביות של העורכים ולא חישוב הסתברותי אמפירי, כך שאי אפשר להסתמך עליהן ישירות כהוכחת עמידה בתקן בלי בדיקה עצמאית שלכם.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי של החברה?

לא. הרישיון הוא CC BY-NC 4.0, מה שאוסר שימוש מסחרי מכל סוג. אם רוצים להשתמש בו בארגון למטרות רווח, צריך לפנות ישירות ל־VIDRAFT ולבקש רישיון מסחרי ייעודי בכתב.

האם יש במאגר תמיכה בעברית?

אין עברית כלל. כל הרשומות מופיעות באנגלית טכנית, כאשר שדות המקור נשמרו בקוריאנית. כל התאמה לדרישות רגולטוריות או שפתיות מקומיות בישראל תדרוש תרגום ועבודה ידנית שלכם.

האם הדאטהסט כולל שאלות ותשובות לבדיקת המודל שלי?

לא, אין כאן פרומפטים, מבחנים או ציונים מוכנים. מדובר בקטלוג קריטריונים שמגדיר איזה סיכונים קיימים ומה הראיה שצריך לחפש, ולא בכלי שמריץ הערכה אוטומטית מקצה לקצה.

מאיפה הגיעו הנתונים ואיך אימתו אותם?

הבסיס מגיע משדות מקור בקוריאנית שעברו עריכה לשפה האנגלית על ידי VIDRAFT. נכון לגרסה 1.0.0-rc1, אף אחד מ־117 הקישורים למאמרים ולחוקים טרם עבר אימות סופי מול מקורות ראשוניים, והסטטוס הזה מסומן מפורשות ברשומות.

איך טוענים

המידע מחולק לקובץ הראשי data/catalog.jsonl ולקובץ ראי בפורמט CSV למי שמעדיף טבלאות. אין כאן ספליט של אימון או מבחן, אלא חלוקה אחת בשם catalog. השדות המרכזיים לעבודה הם diagnostic_id, diagnostic_focus_en, expected_evidence_class והנחיות התיקון. המאגר קל משקל, כולל 17 קבצים בסך הכל, ומופץ כגרסת release candidate. אפשר להריץ בדיקת תקינות מקומית לשלמות הקבצים וההאשים באמצעות הסקריפט verify_dataset.mjs שמגיע במאגר.

from datasets import load_dataset

ds = load_dataset("FINAL-Bench/AX-RAY")

הרישיון

הרישיון הוא CC BY-NC 4.0 של ארגון VIDRAFT. מותר לשתף, להעתיק ולהתאים את החומר רק למטרות לא מסחריות, תוך מתן קרדיט מלא וציון שינויים שבוצעו. שימוש מסחרי מכל סוג, כולל שילוב במוצר עסקי או אימון מערכת מסחרית, אסור לחלוטין אלא אם קיבלתם אישור מסחרי כתוב ונפרד מ־VIDRAFT.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗