GPT
N

natural_reasoning

קוד פתוח

facebookcc-by-nc-4.02025-01-30

מאגר שמציע שאלות חשיבה מורכבות שנבנו מתוך טקסטים קיימים ברשת. הוא מתאים למי שרוצה לאמן מודלים על בעיות היגיון בלי להסתמך על מבחנים שחוקים.

  • 3,732הורדות בחודש
  • 582לייקים

מה זה

המאגר מכיל תת קבוצה של 1.1 מיליון רשומות מתוך פרויקט שכולל במקור 2.8 מיליון שאלות. הנתונים נוצרו בשיטה של תרגום לאחור מתוך מאגרי האימון DCLM ו־FineMath, כלומר לקחו טקסטים מהרשת והפיקו מהם שאלות היגיון מאתגרות. החוקרים ביצעו ניקוי כפילויות וסינון קפדני מול מבחני ביצועים מוכרים כמו MATH, GPQA, MMLU-Pro ו־MMLU-STEM כדי למנוע זיהום נתונים.

כל רשומה כוללת שאלה, תשובה סופית מקורית שחולצה מהטקסט במידת האפשר, ותשובה שנוצרה על ידי המודל Llama3.3-70B-Instruct. מבחינת התשובות המקוריות, ל־18.29% מהשאלות אין תשובת ייחוס כלל, 9.71% מגיעות עם מילה בודדת, 21.58% כוללות תשובה קצרה, וב־50.42% מהמקרים מדובר בתשובה ארוכה ומפורטת.

מתאים ל

  • אימון יכולות חשיבה

    כוונון עדין של מודלי שפה פתוחים על שאלות היגיון ומתמטיקה מורכבות.

  • הערכת ביצועי מודלים

    בדיקת יכולות הסקת מסקנות של מודל מול תשובות שחולצו מטקסטים אמיתיים.

  • מחקר על דאטה סינתטי

    השוואה בין איכות תשובות מקור לבין פלטים שנוצרו על ידי Llama 3.3.

איפה זה נופל

הנתונים כולם באנגלית, בלי שום ייצוג לעברית. הבעיה העיקרית היא שכמעט חמישית מהשאלות מגיעות ללא תשובת ייחוס מאומתת מהמקור, ומסתמכות רק על הפלט של Llama3.3-70B-Instruct, שעלול להכיל הזיות. אם אתם בונים מערכת שמחייבת דיוק מוחלט, תצטרכו לסנן את השאלות האלו החוצה.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

לא. הרישיון הוא CC BY-NC 4.0, מה שאוסר שימוש מסחרי מכל סוג. הוא מיועד למחקר בלבד, ולכן מודלים שמאומנים עליו לא יכולים להיכנס למוצרים מסחריים.

האם המאגר כולל תוכן בעברית?

לא, המאגר כולו באנגלית. השאלות נגזרו ממאגרי רשת באנגלית כמו DCLM ו־FineMath. אם המטרה שלכם היא מודל שמבין עברית, תצטרכו לתרגם את החומר או להשתמש במקור אחר.

איך נאספו השאלות והתשובות?

החוקרים לקחו קטעי טקסט ומתמטיקה ממאגרי אימון וביצעו תרגום לאחור כדי לחלץ מהם שאלות. התשובות מורכבות מפתרונות מקוריים שחולצו מהטקסט, לצד תשובות שיוצרו על ידי המודל Llama3.3-70B-Instruct.

מה מייחד את המאגר הזה בהשוואה למאגרי שאלות אחרים?

השאלות עברו סינון מפני מבחני ביצועים נפוצים כמו MATH ו־GPQA כדי למנוע זיהום נתונים. בנוסף, הוא מתמקד בשאלות חשיבה מאתגרות ומספק גם את שרשרת הפתרון של מודל קיים.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets בפייתון בעזרת פקודת load_dataset לקריאה facebook/natural_reasoning. הקובץ המרכזי מגיע בפורמט jsonl בשם full.jsonl, ואין צורך בבקשת אישור גישה מיוחדת מראש. שימו לב שבחלק מהרשומות חסרות תשובות ייחוס, כך שצריך לסנן שדות ריקים לפני שרצים לאמן.

from datasets import load_dataset

ds = load_dataset("facebook/natural_reasoning")

הרישיון

הרישיון הוא cc-by-nc-4.0. המשמעות פשוטה: השימוש מוגבל למחקר בלבד ואסור לחלוטין לכל מטרה מסחרית. אם תאמנו עליו מודל, לא תוכלו למכור גישה אליו או להטמיע אותו במוצר של החברה שלכם. חובה לתת קרדיט ליוצרים בכל פרסום.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗