GPT
W

WebInstruct-verified

קוד פתוח

TIGER-Labapache-2.02025-04-10

  • science

מאגר שאלות ותשובות מאומתות להסקה לוגית בתחומים מגוונים מעבר למתמטיקה וקוד. הוא נבנה עבור מי שרוצה לפתח או להעריך מודלים באמצעות פתרונות אנושיים קצרים ובדידים.

  • 1,471הורדות בחודש
  • 69לייקים

מה זה

הנתונים מבוססים על איסוף מחדש של צמדי שאלות ותשובות מהרשת מתוך WebInstruct, כאשר הדרישה הראשונית הייתה קיומן של תשובות שנכתבו על ידי בני אדם. פריטים ללא תשובה אנושית נפסלו כבר בשלב הזחילה. כדי להבטיח אימות מדויק, החוקרים נעזרו ב־Gemini-1.5-Pro כדי לבודד שאלות שיש להן תשובות קצרות ומוגדרות היטב בתחומים כמו פיזיקה, כימיה, פיננסים ומדעי הרוח.

לאחר מכן הופעל סינון נוסף בעזרת Gemini-2.0-Flash שיצר שמונה פתרונות לכל שאלה. שאלות שבהן כל שמונה הניסיונות נכשלו סומנו כרועשות או מעורפלות ונזרקו, ובמקביל שאלות שבהן כל השמונה צדקו נמחקו כדי להימנע מדוגמאות פשוטות מדי. המאגר מכיל חלוקות לקובצי Parquet של אימון ומבחן, וכולל גם גרסה ישנה בשם train_legacy שבה התגלו בעיות בשאלות רב-ברירה.

מתאים ל

  • אימון מודלי הסקה רב-תחומיים

    חיזוק יכולות ההסקה של מודלים בפיזיקה, כימיה ופיננסים באמצעות שאלות עם פתרונות אנושיים מאומתים.

  • אימון בחיזוקים עם מודל שופט

    בניית תהליכי RL ישירים שבהם מודל קטן מוודא את נכונות התשובות הקצרות במקום בדיקות טקסטואליות פשוטות.

  • הערכת ביצועי מודלי שפה

    בדיקת יכולת המענה של מודל קיים על שאלות שנבחרו מראש ככאלו שאינן טריוויאליות ואינן מעורפלות.

איפה זה נופל

המאגר מוגבל לאנגלית בלבד, כך שהוא לא יעזור ישירות למי שמאמן מודלים בעברית או מחפש שאלות בהקשר מקומי. מעבר לזה, סינון השאלות נשען כולו על שרשרת מודלים של Gemini. המשמעות היא שההטיות של המודלים האלה וההגדרות שלהם לגבי מה נחשב פשוט מדי או קשה מדי כבר צרובות בתוך הדאטה.

בנוסף, חלק משאלות הבחירה המרובה סבלו מאפשרויות חסרות בגוף השאלה. הבעיה הזו תוקנה בגרסת ה־train העדכנית, אך הגרסה המקורית עדיין יושבת בפיצול train_legacy, ולכן כדאי לוודא שאתם לא מושכים בטעות את הנתונים הישנים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצרים מסחריים?

כן. הרישיון הוא apache-2.0, שמאפשר שימוש מסחרי מלא, כולל אימון מודלים למוצרים פנימיים או חיצוניים. הדרישה העיקרית היא שמירה על הודעת זכויות היוצרים וייחוס ליוצרים.

האם המאגר כולל תוכן בעברית?

לא. המאגר מתויג ומוגדר באנגלית בלבד. אם המטרה שלכם היא מודל שמבין או מנמק בעברית, תצטרכו לתרגם את החומר או לפנות למקורות אחרים.

איך נאספו הנתונים ומה סונן מהם?

החוקרים חזרו למקורות ברשת מתוך WebInstruct ופסלו דפים בלי תשובות אנושיות. מודל Gemini חילץ רק שאלות עם תשובות קצרות וברורות, ונפסלו שאלות שהיו קלות מדי או כאלו שכל הניסיונות של המודל לפתור אותן כשלו.

מה ההבדל בין קובץ ה־train לקובץ train_legacy?

בגרסה המקורית של המאגר נפלו טעויות בחלק משאלות הבחירה המרובה, וחלק מהאפשרויות נשמטו מהטקסט. הגרסה המתוקנת נמצאת ב־train הרגיל, בעוד הגרסה הישנה עם התקלות נשמרה תחת train_legacy.

איך טוענים

טוענים את המאגר ישירות עם ספריית datasets של Hugging Face בלי צורך בהרשאות מיוחדות או אישור גישה מוקדם. הנתונים מאורגנים בקובצי Parquet קומפקטיים שמחולקים ל־train, ל־test ולגרסת ה־legacy.

קחו בחשבון שהתשובות הקצרות מגיעות בפורמטים מגוונים, כולל ביטויי LaTeX, מערכים, מטריצות ומספרים עשרוניים. החוקרים מציינים שלא תמיד אפשר להשוות מחרוזות ישירות, ובמקום זה ממליצים להשתמש במודל ייעודי לאימות תשובות או במודלי שפה כדי לבדוק נכונות.

from datasets import load_dataset

ds = load_dataset("TIGER-Lab/WebInstruct-verified")

הרישיון

המאגר מופץ תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי ומחקרי חופשי, שינוי של הנתונים והפצה מחודשת שלהם. מותר לאמן עליו מודלים מסחריים בלי חובה לחשוף את המשקולות או לשחרר את הקוד, כל עוד מקפידים לתת קרדיט ליוצרים המקוריים ולצרף את עותק הרישיון והודעות זכויות היוצרים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗