GPT
S

sealqa

קוד פתוח

vtllmsapache-2.02025-05-22

שאלות עובדתיות שתוצאות חיפוש ברשת מחזירות עבורן מידע רועש, סותר או לא מועיל. הוא נבנה כדי לבחון מודלים מבוססי חיפוש במצבים שבהם מנוע החיפוש מטעה אותם במקום לעזור.

  • 2,663הורדות בחודש
  • 34לייקים

מה זה

המאגר כולל שאלות עובדתיות שמיועדות למשימות מענה על שאלות עם חיפוש רשת, בהיקף של פחות מאלף רשומות בסך הכל. המטרה שלו היא לבדוק כיצד מודלי שפה מתמודדים עם שאילתות שתוצאות החיפוש שלהן באינטרנט מכילות סתירות פנימיות, רעש או חוסר תועלת ממשי. במקום לתת למודל טקסט נקי, הוא נתקל באתגר שדורש יכולת סינון ואימות מורכבת של המידע שנשלף.

הנתונים מחולקים לשלושה חלקים נפרדים שנשמרים בקובצי פרקט: seal-0, seal-hard, ו־longseal, וכולם מוגדרים כחלוקת בדיקה בלבד. הכרטיס אינו מפרט את אופן איסוף השאלות המקורי, שיטות הסינון או שמות השדות המדויקים בתוך הטבלאות. עם זאת, היוצרים הוסיפו מחרוזת קנרית ייעודית, שנועדה למנוע מבוני מודלים להכניס את השאלות בטעות לתוך נתוני האימון העתידיים שלהם כדי לשמור על תוקף הבדיקה.

מתאים ל

  • הערכת מנועי חיפוש לשפה

    בדיקת ביצועים של מערכות שמשלבות חיפוש רשת כשהתוצאות מכילות סתירות ורעש.

  • מדידת חוסן הזיות

    בחינה אם מודל מסוגל לסרב לענות או להתעלם ממידע כוזב שנשלף מהאינטרנט.

  • השוואת מודלים פתוחים

    הרצת מבחן השוואתי בין מודלי משקולות פתוחות למודלים סגורים בתנאי קיצון.

איפה זה נופל

גודל המאגר קטן מאוד, פחות מאלף דוגמאות בכל החלקים יחד, כך שהוא לא מתאים לאימון אלא לבנצ'מרק בלבד. הכרטיס לא מציין תמיכה בעברית או שפות נוספות מעבר לאנגלית, ואין מידע על תחומי הידע של השאלות. התוצאות מראות שגם מודלים מתקדמים מגיעים לאחוזי דיוק נמוכים מאוד, לפעמים אפס אחוז, מה שמעיד על רמת קושי חריגה שדורשת בדיקה זהירה מול משימות בעולם האמיתי.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מסחרי?

כן, רישיון apache-2.0 מתיר שימוש מסחרי מלא. צריך רק לצרף את תנאי הרישיון ומתן קרדיט ליוצרים, ואין חובה לחשוף את הקוד שלכם.

האם יש במאגר שאלות בעברית?

הכרטיס לא מציין שפות כלל וכל הדוגמאות וההסברים באנגלית. אם אתם בונים מערכת שמיועדת לשוק המקומי, תצטרכו לתרגם את השאלות או לבנות מבחן ייעודי משלכם.

מה הגודל של הדאטהסט והאם נדרש אישור גישה?

המאגר פתוח לחלוטין להורדה ללא צורך באישור, ומכיל פחות מאלף רשומות שמחולקות לשלושה קובצי פרקט. ההורדה והטעינה לוקחות שניות ספורות בגלל הנפח המזערי.

מה ההבדל בינו לבין מבחני שאלות ותשובות רגילים?

הוא מתמקד באופן ספציפי במקרים שבהם מנועי חיפוש מציגים מידע מטעה, סותר או לא יעיל לשאילתה. המטרה אינה לבדוק ידע כללי של המודל, אלא את היכולת שלו להפעיל שיקול דעת מול מקורות רשת בעייתיים.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets באמצעות פקודת load_dataset עם המזהה vtllms/sealqa. צריך לציין בשם את החלק הרצוי מתוך השלושה, seal_0, seal_hard או longseal, ולהגדיר את split כ־test. המאגר ציבורי, שוקל מעט מאוד בגלל מספר הדוגמאות הקטן, ומגיע בקובצי פרקט. להערכת הביצועים היוצרים מפנים לתבנית בדיקה ייעודית בקולאב.

from datasets import load_dataset

ds = load_dataset("vtllms/sealqa")

הרישיון

המאגר מופץ תחת רישיון apache-2.0. הרישיון מתיר שימוש מסחרי, שינוי והפצה, בתנאי ששומרים על הודעת זכויות היוצרים וצירוף עותק של הרישיון המקורי. הוא אינו כופה שיתוף של נגזרות באותו רישיון, ומאפשר להעריך מודלים מסחריים או להשתמש במידע בפיתוח מוצרים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗