GPT
S

SkyPile-150B

קוד פתוח

Skyworkרישיון לא דווח2023-10-23

  • llm
  • casual-lm
  • language-modeling

קורפוס ענק של טקסט סיני מסונן לאימון מודלי שפה, המכיל כ־150 מיליארד טוקנים. הוא מיועד למי שבונה מודל בסיס או מרחיב יכולות שפה במנדרינית.

  • 23,166הורדות בחודש
  • 409לייקים

מה זה

המאגר כולל כ־233 מיליון דפי רשת ציבוריים וייחודיים בסינית, כאשר כל דף מכיל בממוצע מעל 1,000 תווים. המטרה של המפתחים הייתה לייצר קורפוס נקי לאימון מקדים, ולכן העבירו את כל המידע הגולמי תהליכי סינון מחמירים, הסרת כפילויות, וניקוי של תוכן ירוד באמצעות כלי fastText ו־BERT.

המבנה של הנתונים פשוט מאוד ומכיל שדה טקסט יחיד עם התוכן המעובד שחולץ מכל עמוד אינטרנט. כדי להתמודד עם תוכן רגיש או פוגעני, הצוות הפעיל מעל שני מיליון כללים לצד מודל BERT-base שזיהה והסיר רשומות מזיקות, בנוסף לסינון מבוסס כתובות אתרים.

סך הכל מדובר בכ־620 ג'יגה-בייט של טקסט גולמי שמחולק לקובצי jsonl לפי מזהים שמזכירים חלוקות של סריקות רשת, כמו Common Crawl. אין כאן חלוקה מורכבת לנושאים או קטגוריות, אלא זרם אחיד של דפי אינטרנט שעברו סינון אגרסיבי במטרה לשמש תשתית טקסטואלית רחבה.

מתאים ל

  • אימון מקדים של מודלי שפה

    בניית מודלי שפה מאפס הדורשים נפח עצום של טקסט סיני שעבר סינון איכות והסרת כפילויות.

  • המשך אימון למנדרינית

    הרחבת אוצר המילים והיכולות הלשוניות של מודל קיים לכיוון השפה הסינית על גבי 150 מיליארד טוקנים.

  • אימון מודלי סינון וסיווג

    בניית כלים לניתוח טקסט ברשת וזיהוי דפוסים בשפה הסינית מתוך דפי אינטרנט מעובדים.

איפה זה נופל

המאגר מכיל אך ורק סינית. אם אתם מחפשים מקורות בעברית או באנגלית, אין כאן כלום. המפתחים מודים בפירוש שלמרות הסינון, ייתכן שנותרו פרטים מזהים ורגישים כמו כתובות מייל, מספרי טלפון וכתובות IP שנשאבו מאתרי האינטרנט. בנוסף, רשת האינטרנט מלאה בהטיות ותוכן רעיל, כך שאי אפשר להבטיח ניקיון מושלם מחומרים בעייתיים. אם אתם מייעדים מודל למוצר סופי, תצטרכו להריץ שכבות בדיקה וסינון נוספות משלכם.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מסחרי?

כן, לפי כרטיס המאגר שימוש מסחרי נתמך. יחד עם זאת, החומרים כפופים לתנאי Skywork Community License ולרישיון Apache 2.0, ולכן יש לבדוק את מסמך הרישיון המצורף בקובצי המאגר לפני שילובו במוצר.

האם יש במאגר טקסט בעברית?

לא. המאגר מורכב כולו מתוכן באינטרנט הסיני וכולל אך ורק נתונים בשפה הסינית. אין בו שום ייצוג לעברית או לשפות אחרות.

כמה שטח דיסק נדרש כדי להחזיק את המאגר?

מדובר בכ־620 ג'יגה-בייט של טקסט גולמי נקי, המפוזרים על פני 441 קבצים. תצטרכו להכין נפח אחסון משמעותי עוד לפני פריסת הקבצים ועיבודם לאימון.

איך החוקרים סיננו את הנתונים לפני הפרסום?

הם השתמשו ביותר משני מיליון כללים לצד מודל BERT-base כדי לאתר ולהסיר נתונים מזיקים ורגישים. בנוסף, הופעלו כלי fastText לסינון תוכן באיכות נמוכה ובוצע ניקוי כפילויות נרחב.

איך טוענים

הנתונים מחולקים על פני 441 קבצים במאגר, בעיקר קובצי jsonl דחוסים תחת תיקיית data, עם שמות קבצים שמבוססים על מקטעי סריקה. בסך הכל תצטרכו לפנות כ־620 ג'יגה-בייט של שטח אחסון לטקסט הנקי. אין צורך בבקשת אישור גישה ידנית כדי להוריד אותו מההאב. מבנה הרשומה כולל שדה מרכזי אחד בלבד בשם text, כך שאין צורך בפענוח מורכב של מטא-דאטה בעת הטעינה לאימון.

from datasets import load_dataset

ds = load_dataset("Skywork/SkyPile-150B")

הרישיון

בעמוד המאגר לא מוגדר רישיון סטנדרטי בשדות המטא, אך הקבצים כוללים מסמך בשם Skywork Community License ומציינים כפיפות גם ל־Apache 2.0. המפתחים מציינים שהשימוש המסחרי נתמך, אך כל שימוש כזה במודל או בתוצרים הנגזרים מחייב עמידה בתנאי רישיון הקהילה שלהם. מומלץ לקרוא את מסמך ה־PDF המצורף לפני שמשלבים אותו בפיתוח מסחרי.

הרישיון המלא ב־Hugging Face ↗