GPT
C

CrystalCoderDatasets

קוד פתוח

IFModc-by2023-11-30

  • pretrained

המאגר מרכז 1,300 מיליארד טוקנים מטקסט ומקוד ששימשו לאימון מלא של CrystalCoder. הוא מיועד למי שרוצה לשחזר במדויק את תהליך האימון לפי שלבים מוגדרים מראש.

  • 10,532הורדות בחודש
  • 22לייקים

מה זה

הנתונים מחולקים לפי שלושת שלבי האימון המקוריים של המודל, ומשלבים טקסט כללי מתוך SlimPajama וקוד מקור מתוך StarCoder. בשלב הראשון יש כ־345 מיליארד טוקנים של טקסט כללי. השלב השני מרחיב את האימון ל־927 מיליארד טוקנים נוספים המשלבים את יתרת הטקסט יחד עם שני מחזורים של קוד, שעברו אוגמנטציית FIM בשיעור 0.9.

השלב השלישי מתמקד ב־100 מיליארד טוקנים של פייתון וקוד אתרים כמו HTML, CSS ו־JavaScript לאורך שלושה מחזורים, יחד עם תוספת קטנה של 10 מיליארד טוקנים של טקסט ללא גיטהאב. בנוסף, הכרטיס מפרט שלב כוונון הוראות שמכיל כמיליארד טוקנים ממאגרים כמו ShareGPT, SlimOrca ו־CodeAlpaca, שנועדו להכין את המודל לשיחות וליצירת אתרים.

מתאים ל

  • שחזור אימון CrystalCoder

    הרצת תהליך האימון המלא מאפס בדיוק לפי שלבי הטוקנים והמשקולות המקוריים של הפרויקט.

  • אימון מודלי קוד וטקסט

    אימון מודלי שפה מעורבים על שילוב מובנה של טקסט כללי באנגלית וקוד פייתון ופיתוח אתרים.

  • מחקר טכניקות FIM

    בדיקת השפעת אוגמנטציית Fill-in-the-Middle ביחסי אימון שונים על יכולות השלמת קוד.

איפה זה נופל

המאגר מוגבל לשפה האנגלית בלבד, ואין בו תמיכה בשפות אחרות או בעברית. הנתונים נשענים על מקורות קיימים ואינם כוללים עדכונים מעבר לתאריך פרסומם בנובמבר 2023, כך שהם אינם מכירים שינויים חדשים בעולם הקוד או בטקסט חופשי. בנוסף, השימוש באוגמנטציית FIM עלול לדרוש התאמות ייעודיות בארכיטקטורה שלכם אם אתם לא מאמנים מודל שמתוכנן להשלמת קוד באמצע קובץ.

שאלות
נפוצות

האם יש במאגר נתונים בעברית?

לא, המאגר מוגדר רשמית לשפה האנגלית בלבד. הטקסט הכללי מבוסס על SlimPajama באנגלית ועל קבצי קוד מקור. אין כאן מקורות תוכן בעברית.

האם מותר להשתמש בדאטהסט לאימון מסחרי?

האוסף עצמו מופץ תחת רישיון odc-by שדורש ייחוס, אך הוא לא מעניק זכויות על התוכן שבפנים. הקוד והטקסט מגיעים מ־SlimPajama ומ־StarCoder. עליכם לבדוק את הרישיונות של המקורות האלה לפני שימוש מסחרי במודל שנוצר.

באיזה פורמט שמורים הקבצים?

הנתונים לא שמורים בפורמט jsonl או טקסט רגיל, אלא מחולקים ליותר מעשרת אלפים קבצי H5. הם נארזו מראש לעבודה ישירה מול צינורות אימון וטעינת נתונים יעילה. עבודה איתם דורשת כלים שתומכים ב־HDF5.

מה ההבדל בין המאגר הזה ל־StarCoder המקורי?

המאגר אינו מכיל רק קוד, אלא מערבב אותו בשלבים קבועים מראש עם טקסט כללי מ־SlimPajama. בנוסף, הקוד מ־StarCoder עבר אוגמנטציית FIM בשיעורים שונים לפי שלב האימון. זהו תמהיל מוכן לאימון ולא מאגר קוד גולמי.

איך טוענים

המאגר מפוצל ל־10,240 קבצים ומאורגן בתיקיות שלבי אימון. הנתונים שמורים כקבצי HDF5 ארוזים, דוגמת data-00000.h5, כך שאי אפשר לצפות בהם סתם כך בדפדפן או לקרוא אותם ישירות כטקסט פשוט. אין צורך בבקשת אישור גישה מיוחדת להורדה מ־Hugging Face.

כדי לעבוד איתו בפועל צריך להשתמש בקוד האימון של הפרויקט מגיטהאב או בטעינת מצבי dataloader מנקודות ביקורת. המבנה מיועד בעיקר להזנה ישירה של מעבדי אימון בקנה מידה גדול, ולכן מי שמתכנן להשתמש בו צריך להכין מראש סביבה שתומכת בפורמט H5 וצינור עיבוד שמסוגל להתמודד עם היקף כזה של קבצים.

from datasets import load_dataset

ds = load_dataset("IFM/CrystalCoderDatasets")

הרישיון

המאגר מפורסם תחת רישיון odc-by, שמתיר שימוש ומחייב מתן קרדיט. עם זאת, הרישיון חל רק על איסוף הנתונים והאריזה שלהם, ולא על התכנים הפנימיים עצמם. התכנים מגיעים ממקורות שונים של SlimPajama ו־StarCoder, ולכן כל שימוש מסחרי או פיתוח מודל מחייב בדיקה של תנאי השימוש והרישיונות המקוריים של חלקי הקוד והטקסט.

הרישיון המלא ב־Hugging Face ↗