GPT
M

minimind_dataset

קוד פתוח

jingyaogongapache-2.0,cc-by-nc-2.02024-09-09

  • chat
  • sft
  • instruction-tuning
  • reasoning
  • code

חבילת אימון מלאה למודלי שפה קטנים, מאימון מקדים ועד כוונון הוראות וחיזוק. היא חוסכת סינון וניקוי עצמאי למי שרוצה לאמן מודל מאפס במשאבי מחשוב מוגבלים.

  • 5,184הורדות בחודש
  • 113לייקים

מה זה

המאגר כולל קובצי JSONL שמכסים את כל שלבי האימון של פרויקט MiniMind 3. בשלב האימון המקדים הרשומות מופיעות בפורמט חיזוי הטוקן הבא עם שדה טקסט פשוט, ומקורן בטקסטים כלליים, שיחות ומידע מזוקק ממאגרים כמו Magpie-Align ודאטהסטים של deepctrl. הנתונים עברו סינון, הסרת כפילויות ובקרת אורך כדי לאפשר אימון מהיר.

עבור כוונון הוראות, הקבצים בנויים ממערך שיחות מרובה תורות הכולל גם קריאות לכלים עם תגיות מערכת וארגומנטים מובנים. חלק משמעותי מהמידע הזה סונתז באמצעות מודלים כמו qwen3-4b לצד שיחות ממאגרים חיצוניים כמו COIG, Step-3.5-Flash ו־R1-Distill. לצד אלה ישנם קובצי למידת העדפות בפורמט שאלות עם תשובה נבחרת ותשובה שנדחתה, שמקורם בדגימה מתוך DPO-En-Zh-20k, וכן קבצים ייעודיים להסקה מתמטית וסוכנים.

מתאים ל

  • אימון מודל שפה מאפס

    שימוש בקובצי המיני כדי להריץ מחזור אימון מלא על חומרת צרכנים ביתית.

  • כוונון לפעולות סוכן

    לימוד מודלים קטנים להפעיל פונקציות וכלים חיצוניים מתוך נתוני שיחה מובנים.

  • אימון העדפות וחיזוק

    הרצת שלבי DPO או למידת חיזוק באמצעות דוגמאות מוכנות של תשובות מועדפות.

איפה זה נופל

הנתונים מתמקדים אך ורק בסינית ובאנגלית, כך שאין שום תמיכה בעברית. מאחר שחלק ניכר מנתוני הסוכנים והחשיבה נוצר בסינתזה על ידי מודלים מסדרת qwen3, הדאטהסט יורש את ההטיות ואי־הדיוקים של מודלי המקור. בנוסף, חלוקת הטוקנים מותאמת למילון מצומצם מאוד של 6,400 מונחים, כך שטקסטים ארוכים נחתכים סביב מגבלות אורך נמוכות יחסית כדי לחסוך זיכרון.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מודל מסחרי?

לא, השימוש המסחרי חסום. המאגר מסומן תחת רישיון CC-BY-NC-2.0 לצד Apache-2.0, וכולל מקורות שמגבילים שימוש כזה. כל מודל שתאמנו עליו יישאר מוגבל למטרות מחקר וניסוי בלבד.

האם הדאטהסט מכיל טקסטים בעברית?

המאגר אינו מכיל נתונים בעברית כלל. כל התוכן מורכב מטקסטים ומשיחות בסינית ובאנגלית בלבד. אם המטרה היא התאמה לשוק המקומי, תצטרכו לשלב מקורות חיצוניים בעברית.

כמה נפח אחסון דרוש כדי להתחיל לעבוד?

הגרסאות המלאות של האימון המקדים וההוראות שוקלות יחד כ־24GB. אם תבחרו לעבוד רק עם גרסאות ה־mini המומלצות לניסוי מהיר, תצטרכו להוריד פחות מ־3GB בסך הכל.

מאיפה הגיעו הנתונים של כוונון ההוראות והסוכנים?

הנתונים משלבים מאגרי שיחה פתוחים כמו COIG ו־Magpie לצד נתונים סינתטיים שנוצרו במיוחד עבור הפרויקט. היוצר ייצר כ־100,000 דוגמאות של שימוש בכלים ושלבי חשיבה באמצעות מודלי qwen3.

איך טוענים

טוענים את הקבצים ישירות באמצעות ספריית datasets או קריאת קובצי JSONL מקומית, ללא צורך באישור גישה. המאגר מכיל גרסאות מלאות וגרסאות מוקטנות: לקבלת תוצאה מהירה על כרטיס בודד מורידים את pretrain_t2t_mini.jsonl בנפח 1.2GB ואת sft_t2t_mini.jsonl בנפח 1.6GB, במקום הקבצים המלאים ששוקלים יחד כ־24GB. שדות המפתח הם text באימון המקדים, conversations באימון ההוראות, ו־chosen לצד rejected בקובצי המשוב.

from datasets import load_dataset

ds = load_dataset("jingyaogong/minimind_dataset")

הרישיון

המאגר מדווח תחת שני רישיונות במקביל, Apache-2.0 ו־CC-BY-NC-2.0. בגלל נוכחות הרישיון הלא־מסחרי והסתמכות על מקורות מידע מסוימים, לא ניתן להשתמש בדאטהסט הזה למוצרים מסחריים. מודל שתאמנו על החומרים האלה יוגבל למחקר, ניסויים פנימיים או שימוש אישי בלבד, ותצטרכו לתת קרדיט ליוצר.

הרישיון המלא ב־Hugging Face ↗