GPT
T

tulu-3-sft-personas-math

קוד פתוח

allenaiרישיון לא דווח2024-10-30

המאגר מרכז שאלות מילוליות מורכבות במתמטיקה שנוצרו באופן סינתטי בעזרת פרסונות שונות. הוא מיועד למי שרוצה לשפר יכולות פתרון בעיות מתמטיות של מודל דרך כוונון עדין.

  • 9,616הורדות בחודש
  • 15לייקים

מה זה

אלן אינסטיטיוט בנו פה מאגר של 149,960 דוגמאות שנועדו לאימון SFT על פתרון בעיות מתמטיות קשות. הרעיון מבוסס על הרחבת שיטה קיימת ליצירת שאלות מגוונות בעזרת הלבשת פרסונות שונות, מה שמייצר ניסוחים פחות מונוטוניים ממה שרואים בדרך כלל בדאטהסטים סינתטיים.

כל רשומה בנויה משלושה שדות: מזהה ייחודי בשם id, שאלת מקור בשם prompt שמייצגת בעיה מילולית לפי פרסונה, ומערך בשם messages שמכיל את הודעת המשתמש ותשובת המודל בפורמט צ'אט סטנדרטי. הפלטים עצמם לא נכתבו בידי בני אדם אלא הופקו באמצעות המודלים GPT-4o ו־Claude 3.5 Sonnet.

מתאים ל

  • אימון SFT למתמטיקה

    כוונון עדין של מודלי שפה על שאלות מילוליות קשות באנגלית כדי לשפר דיוק מתמטי.

  • בדיקת השפעת פרסונות

    מחקר על האופן שבו ניסוח שאלות דרך דמויות שונות משפיע על איכות ההסבר והפתרון.

  • בניית מאגר סינון

    שימוש בנתונים כבסיס גולמי לניפוי שגיאות חישוב והשוואה מול הגרסה המסוננת של החוקרים.

איפה זה נופל

הטקסט כולו באנגלית בלבד ואין כאן אף מילה בעברית, כך שהוא לא יעזור ישירות למיקוד בשפה המקומית. בנוסף, כל הנתונים סינתטיים לחלוטין ומגיעים ממודלים מסחריים כמו קלוד ו־GPT-4o, מה שמחייב בדיקת איכות קפדנית של נכונות הפתרונות. בעיות מתמטיות סינתטיות נוטות לעיתים להזיות בחישובים, ולכן המפתחים עצמם מציעים גם גרסה מסוננת בנפרד.

שאלות
נפוצות

האם מותר להשתמש במאגר למוצר מסחרי?

הרישיון המוצהר הוא ODC-BY, אבל התוכן נוצר באמצעות המודלים של OpenAI ואנתרופיק. תנאי השימוש של החברות האלה מגבילים אימון של מודלים שמתחרים בהן. אם אתם בונים מודל מסחרי, כדאי להתייעץ משפטית לפני שמזינים את הדאטה הזה.

האם יש במאגר שאלות בעברית?

לא. כל 149,960 הדוגמאות נכתבו באנגלית בלבד. אם אתם רוצים להשתמש בו לפתרון בעיות בעברית, תצטרכו לתרגם את השאלות והתשובות בעצמכם או להסתמך על יכולת התרגום של מודל הבסיס.

באיזה פורמט המידע שמור ואיך הוא מחולק?

המאגר מורכב משני קובצי Parquet עיקריים שמכילים את כלל הדוגמאות לחלוקת train. כל שורה מכילה מזהה, את הפרומפט המקורי ואת מערך ההודעות המלא בין המשתמש לעוזר.

למה יש גרסה מסוננת נפרדת?

מכיוון שהדאטהסט נוצר כולו על ידי מודלים מסחריים, חלק מהתשובות עלולות לכלול שגיאות בחישובים או בניסוח. אלן אינסטיטיוט פרסמו מאגר מסונן נפרד כדי לספק נתונים נקיים יותר למי שרוצה לדלג על שלב הניקוי העצמאי.

איך טוענים

אתם מושכים את המאגר ישירות דרך ספריית datasets באמצעות הפקודה load_dataset עם השם allenai/tulu-3-personas-math או המזהה המלא. אין צורך בבקשת גישה מיוחדת או אישור ידני, המאגר פתוח להורדה ישירה. המידע מחולק לשני קובצי Parquet תחת תיקיית data, ושני השדות המרכזיים שמעניינים אתכם לאימון הם prompt ו־messages.

from datasets import load_dataset

ds = load_dataset("allenai/tulu-3-sft-personas-math")

הרישיון

המאגר מוגדר בכרטיס תחת רישיון ODC-BY הדורש ייחוס, אך המטא-דאטה במערכת לא מדווח רשמית. הבעיה המרכזית היא שהנתונים נוצרו על ידי GPT-4o ו־Claude 3.5 Sonnet, ולכן הם כפופים לתנאי השימוש של OpenAI ואנתרופיק. תנאים אלה מגבילים שימוש בפלטים שלהם לאימון מודלים מתחרים, ולכן שימוש מסחרי במודל שייצא מפה דורש זהירות משפטית.

הרישיון המלא ב־Hugging Face ↗