GPT
M

Magpie-Reasoning-V2-250K-CoT-Deepseek-R1-Llama-70B

קוד פתוח

Magpie-Alignllama3.32025-01-25

המאגר מרכז כרבע מיליון הוראות סינתטיות עם שרשראות חשיבה שנבנו לחיזוק יכולות הסקת מסקנות במודלים. הוא מיועד למי שרוצה לאמן מודל לחשוב שלב אחר שלב על בסיס פלטים מבית דיפסיק ומטא.

  • 888הורדות בחודש
  • 109לייקים

מה זה

מדובר במאגר נתונים סינתטי לגמרי שמכיל בין 100 אלף למיליון רשומות המורכבות מצמדי שאלות ותשובות מפורטות הכוללות שרשרת חשיבה. ההוראות הופקו באמצעות שיטת מגפאי, שבה שלפים מודלים של לאמה את השאלות בעצמם מתוך תבנית פרומפט ריקה, והתשובות נבנו באמצעות מודל חיצוני שמתמחה בהסקה.

מקור השאלות מגיע מתוך גרסה קודמת של פרויקט מגפאי שנוצרה על ידי המודלים של מטא, לאמה 3.1 ולאמה 3.3 בגרסת 70 מיליארד פרמטרים. את התשובות והחשיבה המפורטת יצר המודל המזוקק DeepSeek-R1-Distill-Llama-70B. המאגר מוגש כמקשה אחת בחלוקה לקובצי אימון בלי חלוקה מוגדרת מראש לחלקי בדיקה.

מתאים ל

  • אימון מודלי מחקר להסקה

    כוונון מודלים פתוחים לצורך הפקת שרשראות חשיבה מורכבות במחקר אקדמי.

  • הערכת תהליכי חשיבה

    בדיקת איכות שלבי ההסקה שהופקו מול תשובות של מודלים אחרים באנגלית.

  • כריית דוגמאות לסינון

    בסיס גולמי שממנו ניתן לברור ולנקות דוגמאות איכותיות לניסויי התאמה אישית.

איפה זה נופל

היוצרים מודים במפורש שבגרסה הזו הם לא ביצעו שום סינון על התשובות שנפלטו. זה אומר שיש בפנים תשובות שגויות, חזרתיות, או הזיות שהמודל פלט בלי בקרה, ותצטרכו לסנן את הנתונים בעצמכם לפני שתזינו אותם לאימון כדי לא להרוס את המודל שלכם.

בנוסף, הנתונים נוצרו באנגלית בלבד. אם המטרה שלכם היא מודל שמנמק היטב בעברית, המאגר הזה לא ייתן מענה בלי תרגום והתאמה. כל המידע סינתטי ונשען על הידע וההטיות של מודלי הבסיס של מטא ודיפסיק.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא. היוצרים שחררו את המאגר תחת תנאי רישיון CC BY-NC 4.0 שמגבילים את השימוש למחקר בלבד. בנוסף חלים תנאי הרישוי של מטא עבור לאמה 3.1 ולאמה 3.3, ולכן הוא לא מתאים לפרויקטים שמטרתם רווח או שילוב במוצרים מסחריים.

האם המאגר כולל נתונים בעברית?

לא. המאגר מוגדר כמאגר באנגלית בלבד, וכל ההוראות והתשובות שנוצרו על ידי המודלים נכתבו בשפה זו. כדי להשתמש בו לחיזוק מודל בעברית, תצטרכו לתרגם ולעבד אותו מחדש באופן עצמאי.

איך נאספו השאלות והתשובות במאגר?

ההוראות הופקו ישירות ממודלי לאמה 3.1 ו־3.3 בשיטת מגפאי, שגורמת למודל להשלים שאלות מתוך תבנית שיחה ריקה. התשובות ושרשראות החשיבה נלקחו לאחר מכן ממודל DeepSeek-R1-Distill-Llama-70B. כל התהליך מבוסס על יצירה עצמית של מכונות ללא כותבים אנושיים.

האם הנתונים מוכנים להזנה ישירה לאימון?

לא כדאי למהר לאמן עליהם. יוצרי המאגר מציינים בפירוש שהם לא ביצעו סינון על התשובות שנוצרו. חובה לבצע ניקוי, סינון שגיאות ובדיקת איכות של הנימוקים בעצמכם לפני שמתחילים בתהליך האימון.

איך טוענים

המאגר פתוח לציבור ואינו דורש בקשת גישה מיוחדת. הנתונים מחולקים לעשרה קובצי פארקט שונים תחת תיקיית המידע, וניתן לטעון אותם ישירות באמצעות ספריית המאגרים של הגינג פייס. עיקר המידע שמעניין אתכם פה הוא השדות שמחזיקים את ההוראות ואת שרשרת החשיבה המלאה שמגיעה בתשובה. היות שמדובר בקבצים מרובים עם פלטים ארוכים במיוחד, תצטרכו לוודא שיש לכם מספיק זיכרון עבודה ואחסון פנוי לפריסת כל חלקי הרכבת הנתונים לפני הרצת אימון.

from datasets import load_dataset

ds = load_dataset("Magpie-Align/Magpie-Reasoning-V2-250K-CoT-Deepseek-R1-Llama-70B")

הרישיון

המאגר מוגדר ברישיון לאמה 3.3 יחד עם הגבלות רישיון CC BY-NC 4.0, ומיועד למחקר בלבד. המשמעות היא שאין פה היתר לשימוש מסחרי מכל סוג. בנוסף, חלות כאן מגבלות הרישוי של מטא לגבי שימוש בתוצרי לאמה, כך שאי אפשר לקחת את הנתונים האלה כדי לבנות או לשפר מוצר מסחרי סגור.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗