GPT
C

ClimbMix

קוד פתוח

OptimalScaleapache-2.02025-04-18

טקסטים פתוחים שעברו שחזור מטוקנים של אנבידיה לאימון מודלי שפה חסכוניים. המטרה כאן היא ביצועים גבוהים במינימום טוקנים בלי להסתבך עם קבצים בינאריים.

  • 43,634הורדות בחודש
  • 35לייקים

מה זה

המאגר מבוסס על ClimbMix, קורפוס של 400 מיליארד טוקנים שאנבידיה בנתה לאימון מקדים. במקור החומר חולק לאלף קבוצות נושאיות, עבר סיווג לזיהוי פרסומות וערך לימודי, נוקה מחומר ירוד וסודר מחדש לפי משקלים שנקבעו במחקר. המטרה הייתה לקבל קורפוס קומפקטי שמביא תוצאות תחת תקציב חישוב מוגדר.

אנבידיה פרסמה את הדאטה כשהוא כבר מקודד בטוקנים של gpt-2, מה שהקשה על קריאה ישירה ואימון עם טוקנייזרים אחרים. צוות OptimalScale לקח את הרצפים האלה, המיר אותם בחזרה לטקסט רגיל וארז אותם מחדש בפורמט jsonl שמחולק לקבצים ממוספרים.

מתאים ל

  • אימון מקדים של מודלי שפה

    בסיס טקסטואלי איכותי לאימון מודלים קטנים ובינוניים באנגלית תחת תקציב אימון מוגבל.

  • אימון טוקנייזר מותאם

    בניית מילון מותאם על טקסט גולמי מסונן במקום להסתמך על החלוקה של gpt-2.

  • הערכת תערובות דאטה

    בדיקת השפעת סינון חינוכי וסיווג נושאי על התכנסות מודלים לעומת סריקות רשת רגילות.

איפה זה נופל

הנתונים קיימים באנגלית בלבד ואין פה עברית בכלל. הטקסט עבר דה-טוקניזציה מטוקנים של gpt-2, תהליך שעלול לייצר פגמים ברווחים ובתווים מיוחדים. המפרסמים לא נוטלים אחריות על תוכן, דיוק או עדכונים, והחומר משקף את הסינונים המקוריים שנועדו להוריד פרסומות אבל לא מבטיחים ניקיון מוחלט משגיאות.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

כן, הרישיון המדווח הוא apache-2.0 והוא מתיר שימוש מסחרי מלא. תוכלו לאמן מודלים למוצרים פנימיים או חיצוניים בלי לשתף את המשקולות. יש לשמור על תנאי הייחוס וכתב הוויתור של הרישיון.

האם יש כאן תוכן בעברית?

לא, המאגר מוגדר רשמית בשפה האנגלית בלבד. אם אתם צריכים לאמן מודל שמבין עברית תצטרכו לשלב מקורות אחרים. לא הייתי בונה עליו שום יכולת מקומית.

איך הדאטהסט הזה נוצר ביחס למקור של אנבידיה?

אנבידיה הפיקה את המאגר המקורי עם אלף קבוצות נושא וסינון של ערך לימודי, אך שחררה אותו רק כרצפי מספרים מקודדים. OptimalScale לקחו את הטוקנים האלה והמירו אותם חזרה לטקסט רגיל בעזרת הטוקנייזר. זו גרסה קהילתית בלתי רשמית שמנגישה את התוכן כקבצי jsonl.

כמה קבצים יש במאגר ואיך הם נראים?

המאגר כולל 102 קבצים סך הכל, כשרובם קובצי jsonl ממוספרים כמו part_0 ו־part_1. הטקסט בפנים מחולק לשורות ומכיל את הפלט ששוחזר. מומלץ לעבוד עם טעינה מוזרמת כדי לא לחנוק את שטח האחסון בשרת.

איך טוענים

החומר מחולק ל־102 קבצים, כולל קובצי חלקים כמו part_0.jsonl ו־part_1.jsonl. אין צורך לבקש אישור גישה והמאגר פתוח להורדה ישירה דרך ספריית הדאטהסטים הרגילה. מכיוון שמדובר בשחזור של מאות מיליארדי טוקנים לטקסט קריא, הנפח הכולל על הדיסק כבד מאוד ומומלץ להזרים את השורות ישירות לאימון במקום להוריד הכל בבת אחת.

from datasets import load_dataset

ds = load_dataset("OptimalScale/ClimbMix")

הרישיון

הרישיון הוא apache-2.0, שמאפשר שימוש מסחרי, שינוי והפצה ללא דרישה לפתוח את הקוד שלכם או את המודל המאומן. עליכם לכלול עותק של הרישיון המקורי וכתב הוויתור, ולתת קרדיט למפרסמים ולמאמר המקורי של אנבידיה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗