GPT
F

FACTS-grounding-public

קוד פתוח

googlecc-by-4.02024-12-18

  • factuality
  • grounding
  • benchmark
  • Google DeepMind
  • Google Research

מאגר מבחן שבודק אם מודלים נצמדים לעובדות מתוך מסמכים ארוכים במקום להזות. גוגל בנו כאן 860 דוגמאות שנועדו לבחון דיוק וביסוס תשובות בעולם האמיתי.

  • 1,318הורדות בחודש
  • 47לייקים

מה זה

גוגל דיפמיינד וגוגל מחקר שחררו כאן 860 רשומות שנבנו בידי אדם כדי לבדוק יכולת ביסוס עובדתי. כל רשומה כוללת הוראת מערכת שמנחה את המודל לענות אך ורק על בסיס הטקסט המצורף, בקשת משתמש עם שאלה מוגדרת, ומסמך מקור ארוך שמכיל את המידע הנחוץ, למשל דוחות כספיים שהוגשו לרשות ניירות ערך בארצות הברית.

המאגר מיועד למשימות של מענה על שאלות בהקשר רחב, ומטרתו לבדוק אם המודל מסוגל למזג מידע מורכב ממסמך שלם בלי להמציא פרטים. לצד קובץ הדוגמאות הראשי ישנו קובץ ייעודי עם פרומפטים להערכה, שמגדיר כיצד מודלי שופט צריכים למדוד את איכות התשובות שנפלטו.

מתאים ל

  • בדיקת הזיות בסיכום מסמכים

    בחינה קפדנית אם המודל מסתמך רק על דוחות ארוכים או ממציא עובדות מתוך הזיכרון שלו.

  • כיול שופט אוטומטי לתשובות

    שימוש בפרומפטים המובנים כדי לבדוק וליישר קו במערכות הערכה שמבוססות על מודלי שפה.

  • השוואת מודלים בשליפת מידע

    הרצת מבחן השוואתי בין גרסאות שונות כדי למדוד יכולת סינתזה של טקסטים פיננסיים ומורכבים.

איפה זה נופל

גוגל מודים בגלוי שההערכה במבחן הזה נשענת על מודלי שפה אחרים שמשמשים כשופטים אוטומטיים, תהליך שעלול לייצר רעש ואי דיוקים בדירוג למרות הניסיון למתן את זה באמצעות שקלול כמה מודלים מובילים במקביל. בנוסף, המאגר מתמקד אך ורק בביסוס תשובות על טקסטים ארוכים, בלי כיסוי של מקורות מידע קצרים או סוגי מדיה אחרים. הנתונים זמינים באנגלית בלבד, כך שאם אתם בונים מוצר בעברית, המבחן הזה לא יעזור לכם לבדוק הזיות בשפה המקומית.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצרים מסחריים?

כן, הרישיון הוא קריאייטיב קומונס מסוג ייחוס 4.0 שמתיר שימוש מסחרי מלא. הדרישה העיקרית היא מתן קרדיט ברור ליוצרים לפי ההנחיות במסמך הטכני שלהם. אין כאן הגבלה שמחייבת שחרור קוד פתוח של המערכת שאתם בונים.

האם הדאטהסט מתאים לבדיקת מודלים בעברית?

הנתונים כוללים טקסטים באנגלית בלבד. אם תרצו לבדוק ביצועים בעברית תצטרכו לתרגם את המסמכים והשאלות בעצמכם, אך ייתכן שחלק מהמורכבות המקורית של הניסוחים תלך לאיבוד. לבדיקה אותנטית של מודל עברי עדיף לייצר סט נתונים ייעודי.

כמה מקום המאגר תופס והאם קשה להריץ אותו?

מדובר במאגר זעיר שמכיל בסך הכל 860 דוגמאות בקובצי טקסט פשוטים. הוא יורד למחשב תוך שניות בודדות ולא דורש משאבי זיכרון או אחסון חריגים. מה שייקח זמן ומשאבים הוא שליחת הפניות והרצת המודלים שלכם על הטקסטים הארוכים שנמצאים בתוכו.

מאיפה הגיעו הנתונים ומי בנה את הדוגמאות?

הדוגמאות נכתבו ועובדו על ידי אנשי צוות בגוגל דיפמיינד וגוגל מחקר כדי לייצר מבחן תקני ואחיד. הטקסטים מבוססים על מסמכים ממשיים ממגוון תחומים, כולל דוחות פיננסיים רשמיים של חברות ציבוריות בארצות הברית. כל דוגמה כוללת גם את השאלה הממוקדת וגם את המקור המלא שמכיל את התשובה.

איך טוענים

אין צורך באישור גישה מיוחד, המאגר פתוח להורדה ישירה ומכיל ארבעה קבצים בלבד. הקבצים המרכזיים שמורים בפורמט פשוט של טבלאות פסיקים, evaluation_prompts.csv ו־examples.csv, כך שאפשר לטעון אותם בקלות עם פנדס או דרך ספריית הדאטהסטים הרגילה.

השדות שחשוב לעבוד איתם בכל שורה הם ההוראה הכללית, בקשת המשתמש ומסמך ההקשר המלא. גודל הנתונים זעיר מבחינת נפח אחסון כי יש בו פחות מאלף רשומות, מה שמאפשר להריץ עליו מבחנים במהירות בלי תשתית כבדה.

from datasets import load_dataset

ds = load_dataset("google/FACTS-grounding-public")

הרישיון

המאגר מופץ תחת רישיון פתוח מסוג קריאייטיב קומונס ייחוס 4.0. הרישיון מתיר שימוש מסחרי, מחקרי, שינוי והפצה של הנתונים, כל עוד אתם מעניקים קרדיט מתאים לגוגל ולחוקרים ומציינים את השינויים שביצעתם. הרישיון אינו מחייב אתכם לשתף תוצרי מודלים באותו הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗