GPT
M

Magpie-Reasoning-V1-150K

קוד פתוח

Magpie-Alignllama32024-07-11

המאגר מרכז 150 אלף זוגות הוראה ותשובה סינתטיים לחלוטין שמיועדים לשיפור יכולות חשיבה, תכנות ומתמטיקה. הוא חוסך איסוף ידני ומביא שאלות מורכבות שנוצרו ישירות מתוך מודלי שפה גדולים.

  • 922הורדות בחודש
  • 61לייקים

מה זה

המאגר מכיל דוגמאות אימון סינתטיות שנבנו בשיטת Magpie, שבה מפיקים שאילתות משתמש ישירות ממודל שפה על ידי הזנת תבנית השיחה בלבד. ההוראות נוצרו באמצעות Qwen2-72B-Instruct, ואילו התשובות הופקו באמצעות Llama 3 70B Instruct כדי להבטיח מענה מעמיק ומפורט.

הסינון התמקד במשימות הדורשות הסקה לוגית, פתרון בעיות מתמטיות, כתיבת קוד ודיבאגינג. המפתחים הגדירו רף איכות קלט ברמה טובה ומעלה, דרגת קושי מוגדרת, וניקוד תגמול של מינוס עשר ומעלה. בנוסף, הוסרו חזרות והוראות מקוטעות שמסתיימות בנקודתיים.

מתוך כלל התוצרים שעמדו בתנאי הסינון, נבחרו בדיוק 150 אלף הרשומות בעלות התשובות הארוכות ביותר. הבחירה בתשובות ארוכות נועדה לספק שלבי חשיבה מפורטים ומבנה מעמיק עבור משימות מורכבות, ללא חלוקה פנימית לתתי קבוצות נוספות מעבר לקובצי האימון הראשיים.

מתאים ל

  • אימון מודלים להסקה

    אימון הוראות של מודלי קוד פתוח כדי לשפר את יכולת פתרון הבעיות והמענה הלוגי.

  • כוונון למשימות קוד

    שיפור ביצועים של מודלים קטנים בכתיבת סקריפטים ובאיתור שגיאות בקוד קיים.

  • מחקר על דאטה סינתטי

    בדיקת השפעת נתונים שנוצרו ממודל אחד על ביצועי מודל אחר ללא התערבות אנושית.

איפה זה נופל

הנתונים כולם באנגלית בלבד, ואין כאן עברית כלל. מדובר במידע סינתטי לגמרי שנוצר ממודלים ביולי 2024, כך שאין כאן אימות אנושי לעובדות, לקוד או לחישובים המתמטיים. מודלים נוטים להמציא פתרונות שנראים משכנעים אך שגויים לחלוטין, במיוחד בחישובים מורכבים ובדיבאגינג. בנוסף, הבחירה המכוונת בתשובות הארוכות ביותר עלולה ללמד מודל חדש לייצר מלל מיותר במקום לענות בקצרה כשנדרש.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא, השימוש המסחרי חסום בפועל. המפתחים דורשים עמידה ברישיון CC BY-NC 4.0 לצד תנאי הרישיון של מטא ועליבאבא. תנאי זה אוסר כל פעילות מניבה או מסחרית על בסיס הנתונים.

האם המאגר כולל תוכן בעברית?

לא, המאגר מוגדר ומסונן לשפה האנגלית בלבד. כל ההוראות והתשובות הופקו באנגלית עבור משימות קוד והסקה. אימון עליו לא ישפר יכולות שפה מקומיות.

באיזה אופן נאספו הנתונים?

הנתונים לא נאספו ממשתמשים אלא הופקו במלואם על ידי מכונות בשיטת Magpie. מודל Qwen2-72B-Instruct ייצר את השאלות מתוך תבניות שיחה ריקות, ומודל Llama 3 70B Instruct כתב את התשובות.

במה הוא שונה ממאגרי Magpie אחרים?

מאגר זה מתמקד באופן בלעדי בתחומי מתמטיקה, תכנות והסקה לוגית. בנוסף, הוא כולל רק 150 אלף דוגמאות שבהן התשובות היו הארוכות ביותר, כדי להבטיח פירוט מקסימלי בכל פתרון.

איך טוענים

הנתונים מחולקים לשני קובצי Parquet תחת תיקיית המידע ואינם דורשים הגשת בקשת גישה מיוחדת ביומן הרישום. טוענים אותם באמצעות ספריית datasets הרגילה של Hugging Face בהפניה ישירה למזהה המאגר. כל רשומה כוללת את ההוראה ואת התשובה שנוצרה עבורה, לצד מדדי איכות שנוצרו בתהליך הסינון. בגלל אורכן של התשובות שנבחרו, כדאי לקחת בחשבון את מגבלת האסימונים בחלון ההקשר בזמן אימון כדי למנוע חיתוך של שלבי החישוב והקוד.

from datasets import load_dataset

ds = load_dataset("Magpie-Align/Magpie-Reasoning-V1-150K")

הרישיון

הרישיון מוגדר תחת תנאי Llama 3, אך הכרטיס דורש לעמוד במקביל גם בהסכם של Tongyi Qianwen וברישיון CC BY-NC 4.0. המשמעות המעשית היא איסור מוחלט על שימוש מסחרי בגלל התנאי הלא מסחרי, וחובה לתת ייחוס ליוצרים. מודל שתאמנו על הדאטהסט הזה לא יוכל לשמש מוצר מסחרי, ומוגבל לצרכי מחקר וניסוי בלבד.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗