GPT
A

AmberDatasets

קוד פתוח

IFModc-by2023-11-21

  • pretrained

זהו מאגר האימון המלא והמעובד של מודל Amber, המחולק בדיוק לפי שלבי האימון שלו. הוא מתאים למי שרוצה לשחזר במדויק את תהליך הלמידה או לחקור את התנהגות המודל בכל נקודת זמן.

  • 4,480הורדות בחודש
  • 38לייקים

מה זה

המאגר כולל רצפי נתונים מוכנים מראש לאימון מקדים, שמגיעים מתערובת מגוונת של מקורות רשת, קוד ותוכן אקדמי. התערובת מכילה 665.01 מיליארד טוקנים מתוך Refined-Web, לצד 291.92 מיליארד טוקנים של קוד מתוך StarCoder, ו־197.67 מיליארד מתוך C4. בנוסף שולבו מקורות ממוקדים יותר כמו Arxiv עם 30.00 מיליארד טוקנים, Book עם 28.86 מיליארד, Wikipedia עם 23.90 מיליארד, ודיונים מתוך StackExchange בהיקף של 21.75 מיליארד, כך שבסך הכל המאגר מורכב מ־1259.13 מיליארד טוקנים.

הנתונים כבר עברו חלוקה לטוקנים ומסודרים ב־360 מקטעים שונים. כל רשומה במאגר מורכבת מ־2049 מזהי טוקנים מוכנים להזנה ישירה למודל, בהתאמה מלאה לנקודות הבדיקה שנשמרו לאורך אימון המודל המקורי.

מתאים ל

  • שחזור אימון מודלים

    אימון ובדיקה מחדש של שלבי הלמידה של מודל Amber באמצעות 360 מקטעי הנתונים.

  • מחקר על דאטה מקודד

    ניתוח התנהגות מודלים על רצפים של 2049 טוקנים המשלבים קוד, מאמרים ודפי רשת.

  • בדיקת נקודות שמירה

    הערכת ביצועי מודל בכל נקודת בדיקה אל מול מקטע הנתונים הספציפי שבו הוא אומן.

איפה זה נופל

המאגר מוגדר לשפה האנגלית בלבד, ולכן אין מה לחפש כאן טקסטים בעברית או תמיכה בלוקליזציה ישראלית. הנתונים לא מגיעים כטקסט גולמי אלא כרצפי מספרים שמתאימים רק לטוקנייזר של Amber, מה שמקשה על מיון או סינון עצמאי של תוכן פגום. בנוסף, המקורות מבוססים על סריקות רשת כלליות שכוללות הטיות קיימות, והכרטיס לא מפרט אילו מנגנוני סינון הופעלו על הטקסט המקורי לפני שלב הטוקניזציה.

שאלות
נפוצות

האם המאגר כולל טקסט בעברית?

לא. המאגר מוגדר באנגלית בלבד ומבוסס על מקורות כמו StarCoder, Arxiv ו־Refined-Web. אין בו תכנים בעברית.

איך המידע שמור בתוך הקבצים?

הנתונים אינם שמורים כטקסט קריא אלא כקבצי jsonl עם אינדקסים של טוקנים בשדה token_ids. כל רשומה כוללת בדיוק 2049 מזהי טוקנים שמיועדים לטעינה עם הטוקנייזר של המודל.

האם מותר להשתמש במאגר לפיתוח מודל מסחרי?

המאגר מופץ ברישיון ODC-BY שדורש ייחוס, אך היוצרים מדגישים שהרישיון מכסה את המאגר ולא את התוכן של כל מקור בנפרד. בנוסף, התיעוד מציין גם את רישיון Apache 2.0, ולכן יש לוודא התאמה לרישיונות המקור.

מה הגודל של המאגר מבחינת היקף מילים?

המאגר מורכב מ־360 מקטעים המכילים יחד 1259.13 מיליארד טוקנים. החלק הגדול ביותר מגיע מ־Refined-Web עם 665.01 מיליארד טוקנים, והשאר מקוד, ספרים ומאמרים.

איך טוענים

הנתונים מחולקים לקבצי train_000.jsonl עד train_359.jsonl, ואין צורך בבקשת גישה מיוחדת כדי להוריד אותם דרך ספריית datasets. כל שורה בקובץ מכילה את השדה token_ids עם אינדקסים מספריים. כדי לקרוא את הטקסט המקורי בעיניים תצטרכו להשתמש בטוקנייזר של מודל Amber ולבצע פעולת פענוח.

from datasets import load_dataset

ds = load_dataset("IFM/AmberDatasets")

הרישיון

המאגר משוחרר תחת רישיון ODC-BY, שמחייב מתן קרדיט ליוצרים. עם זאת, ברישיון מצוין במפורש שהזכויות ניתנות על המאגר עצמו ולא על התכנים הפנימיים שלו בנפרד. בנוסף, יש סתירה מסוימת בתיעוד שמזכיר גם רישיון Apache 2.0. לפני אימון מודל מסחרי חובה לבדוק את תנאי השימוש של מקורות המידע המקוריים כמו C4 ו־Refined-Web.

הרישיון המלא ב־Hugging Face ↗