GPT
S

SlimPajama-6B

קוד פתוח

DKYoonרישיון לא דווח2023-08-21

דגימה קומפקטית של שישה מיליארד טוקנים מתוך מאגר ענק של טקסט רשת. הוא נועד למי שרוצה לאמן או לבדוק מודל שפה בלי להוריד שני טרה-בייט של מידע.

  • 18,736הורדות בחודש
  • 66לייקים

מה זה

המאגר מכיל 5,489,000 שורות טקסט שנדגמו מתוך SlimPajama של חברת Cerebras. היוצר הוריד עשירית אחת מתוך עשרת החלקים של המאגר המקורי, שממילא עבר ערבוב לפני החלוקה, ודגם ממנה עוד עשרה אחוזים. גם קבוצות הוולידציה והמבחן נדגמו באותו אופן כדי לשמור על גודל הגיוני.

רוב התוכן מגיע מאינטרנט פתוח. הנתונים מתחלקים ל־54.1 אחוזים מ־Commoncrawl ו־28.7 אחוזים מ־C4. יתר החלקים כוללים קוד מ־GitHub שתופס 4.2 אחוזים, ספרים ב־3.7 אחוזים, מאמרים מ־ArXiv בשיעור של 3.4 אחוזים, ויקיפדיה עם 3.1 אחוזים ותוכן טכני מ־StackExchange בנפח של 2.8 אחוזים. החלוקה הזו דומה מאוד למקור, עם סטייה קלה לטובת דפי רשת כלליים.

מתאים ל

  • אימון מקדים למודל קטן

    הרצה מהירה של אימון מודל שפה קומפקטי על שישה מיליארד טוקנים בלי צורך בתשתית אחסון יקרה.

  • בדיקת ארכיטקטורה חדשה

    הרצת ניסויי כוונון ובדיקת התכנסות של מודלים לפני מעבר לאימון מלא על מאגר של מאות מיליארדי טוקנים.

  • מחקר על דחיסת דאטה

    הערכת ביצועי מודל שפה כשהוא מאומן על פילוחים שונים מתוך נתוני רשת, קוד וספרים באנגלית.

איפה זה נופל

הטקסט כולו באנגלית בלבד. אם אתם בונים משהו שצריך להבין עברית, אין פה שום דבר שיעזור לכם. בנוסף, מדובר בדגימה חלקית של עשרה אחוזים מחלק בודד, כך שנושאים נדירים או שאילתות קצה שהופיעו במאגר המלא עלולים להיעלם לחלוטין. רוב המידע נשען על סריקות רשת של Commoncrawl ו־C4, מה שאומר שתפגשו רעש, טעויות וניסוחים באיכות משתנה שלא מתאימים לכל צורך.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מסחרי?

לא מומלץ להסתמך עליו כרגע. היוצר לא הגדיר שום רישיון במאגר, ולכן אין היתר שימוש מפורש. אם אתם בונים מוצר לחברה, צריך לפנות למאגר המקורי של Cerebras ולבדוק את תנאי השימוש שלו.

כמה מקום המאגר תופס בדיסק?

הוא שוקל 24 גיגה-בייט כשהוא פרוס. זה קטן משמעותית מהמאגר המקורי שעובר את רף שני הטרה-בייט, כך שאפשר להוריד אותו בקלות יחסית למחשב מקומי או לשרת אימון בודד.

האם יש בו טקסטים בעברית?

לא, המאגר מסומן ומוגדר באנגלית בלבד. כל המקורות שנדגמו, מוויקיפדיה ועד פורומים, מתמקדים בטקסט אנגלי. לפרויקטים מקומיים בעברית תצטרכו לחפש מקורות נתונים אחרים.

איך המאגר הזה נוצר מהמקור?

היוצר לקח עשירית אחת מתוך המאגר המקורי של Cerebras, ולאחר מכן דגם מתוכה עוד עשרה אחוזים. התוצאה היא 5,489,000 שורות שמכילות בערך שישה מיליארד טוקנים באותו יחס מקורות.

איך טוענים

הקבצים מאוחסנים בפורמט Parquet, מחולקים ל־48 קובצי אימון לצד קובצי ולידציה ובדיקה, כך שאין צורך באישור גישה מיוחד להורדה דרך ספריית datasets. הנפח של המאגר לאחר פריסה תופס 24 גיגה-בייט בדיסק, שזה הבדל עצום לעומת יותר משני טרה-בייט במקור. הטעינה פשוטה ומהירה, אך יש לוודא שיש לכם מספיק זיכרון עבודה ומקום פנוי לכתיבת הקבצים הפרוסים.

from datasets import load_dataset

ds = load_dataset("DKYoon/SlimPajama-6B")

הרישיון

היוצר לא דיווח על רישיון כלל בדף המאגר. מבחינה משפטית, היעדר רישיון מוגדר משאיר את השימוש בשטח אפור ומסוכן, במיוחד אם אתם מתכננים להוציא מזה מוצר מסחרי. לפני שאתם מאמנים מודל על הנתונים האלה, תצטרכו לבדוק את תנאי השימוש של SlimPajama המקורי ולוודא שהזכויות על המקורות השונים מתאימות לתוכניות שלכם.

הרישיון המלא ב־Hugging Face ↗