GPT
K

K2Datasets

קוד פתוח

IFModc-by2024-05-09

תערובת נתונים עצומה של כ־1.4 טריליון טוקנים ששימשה לאימון המודל K2. המאגר מציע שילוב מובנה של קוד, טקסט מדעי, ויקיפדיה ואינטרנט שנבנה כדי להתחרות במודלים גדולים.

  • 18,829הורדות בחודש
  • 20לייקים

מה זה

המאגר מכיל את תערובת הנתונים המלאה ששימשה לאימון מודל השפה K2, בהיקף של כ־1.4 טריליון טוקנים. הנתונים מחולקים לשני שלבי אימון עיקריים. השלב הראשון כולל כ־1.3 טריליון טוקנים, כאשר כמעט מחצית מהנפח מגיע מ־RefinedWeb (47.1%), לצד ויקיפדיה של RedPajama שהוכפלה פי שישה (10.2%), מאמרים אקדמיים מ־s2orc ו־arXiv, קוד מ־StarCoder, וטקסטים משפטיים מ־Pile of Law.

השלב השני ממוקד יותר ומכיל כ־69.4 מיליארד טוקנים שנועדו לכוונון וחיזוק יכולות ספציפיות. בשלב הזה מובילים קוד פייתון (29.6%), מתמטיקה מ־Open Web Math ו־Algebraic Stack (יחד מעל 36%), וטקסטים מובחרים ממאגרים כמו peS2o, ספרים וויקיפדיה פשוטה. הנתונים לא נאספו מאפס אלא נדגמו ועובדו מתוך מאגרי קוד פתוח מוכרים, לפי מדריך שפורסם על ידי צוות LLM360.

מתאים ל

  • אימון מקדים של מודלי שפה

    בסיס נתונים רחב של 1.4 טריליון טוקנים שמתאים לאימון מודלים מבוססי ארכיטקטורה פתוחה מאפס.

  • אימון המשך בקוד ומתמטיקה

    שימוש בחלק השני של המאגר לחיזוק יכולות חישוביות, לוגיות ותכנותיות במודל קיים.

  • מחקר על תערובות נתונים

    ניתוח השפעת היחסים בין קוד, מדע וטקסט רגיל על ביצועי המודל הסופי.

איפה זה נופל

כרטיס הנתונים מציין במפורש שמשתמשים צריכים להיות מודעים לסיכונים, הטיות ומגבלות, אך אינו מפרט אותם וכותב שדרוש מידע נוסף להמלצות. אין כאן תיעוד לגבי סינון רעלים, פרטיות או שפות שאינן אנגלית. בנוסף, אין פירוט על נוכחות עברית, ולפי המקורות שמבוססים בעיקר על הרשת באנגלית, קוד וספרות מדעית, התוכן בעברית שואף לאפס.

שאלות
נפוצות

האם המאגר כולל תוכן בעברית?

הכרטיס לא מדווח על תמיכה בשפות נוספות או על נוכחות של עברית. רוב המקורות מורכבים ממאמרים אקדמיים באנגלית, קוד תוכנה, ודפי אינטרנט כלליים, כך שאין לבנות עליו לפרויקטים שדורשים עברית.

האם מותר להשתמש בדאטהסט לאימון מודל מסחרי?

הרישיון של המאגר הכולל הוא odc-by, שמתיר שימוש מסחרי תחת מתן ייחוס למחברים. יחד עם זאת, התערובת מכילה דאטהסטים ממקורות שונים כמו RefinedWeb ו־StarCoder, ולכן מומלץ לוודא שתנאי המקורות הללו מתאימים לשימוש המיועד שלכם.

איך מחולקים הנתונים בתוך המאגר?

הדאטהסט מורכב מ־382 קובצי JSONL שמחולקים לפי נתחי מידע. התוכן עצמו בנוי לפי שני שלבי האימון של מודל K2, הראשון מכיל 1.3 טריליון טוקנים מרחבי הרשת והספרות, והשני כולל 69.4 מיליארד טוקנים עם דגש על פייתון ומתמטיקה.

מה ההבדל בין שלב 1 לשלב 2 במאגר?

שלב 1 נועד לבניית הידע הכללי של המודל וכולל בעיקר דפי אינטרנט כלליים, מאמרים, משפט וספרים. שלב 2 מקטין את הטקסט הכללי ומעלה בצורה חדה את שיעור הקוד בפייתון ותכנים מתמטיים מתקדמים כדי לשפר חשיבה לוגית.

איך טוענים

המאגר מחולק ל־382 קבצים בפורמט JSONL, תחת שמות כמו chunk_0.jsonl עד chunk_103.jsonl. אין צורך בבקשת אישור גישה מיוחדת כדי להוריד את הקבצים, אך מדובר בהיקף עצום של טוקנים שמחייב תשתית אחסון רחבה ורוחב פס משמעותי. טוענים אותו ישירות דרך ספריית datasets או על ידי הורדה ועיבוד מקבילי של קובצי ה־JSONL.

from datasets import load_dataset

ds = load_dataset("IFM/K2Datasets")

הרישיון

הרישיון המדווח של המאגר הוא odc-by. רישיון זה מאפשר שימוש חופשי, כולל שימוש מסחרי והתאמה של הנתונים, בתנאי שניתן קרדיט מתאים ליוצרים המקוריים. עם זאת, המאגר מורכב מתתי-מאגרים שונים כמו RefinedWeb ו־StarCoder, ולכן כדאי לבדוק אם לאחד הרכיבים יש תנאי שימוש מגבילים משלו לפני שמאמנים מודל מסחרי.

הרישיון המלא ב־Hugging Face ↗