GPT
Y

yayi2_pretrain_data

קוד פתוח

wenge-researchapache-2.02023-12-25

מאגר ענק של טקסטים בסינית ובאנגלית שסוננו מתוך מאות טרה-בייטים. הוא מיועד למי שבונה או מאמן מודלי שפה מאפס ומחפש תערובת איכותית של תוכן כללי ומקצועי.

  • 15,574הורדות בחודש
  • 60לייקים

מה זה

המאגר כולל מעל מאה מיליארד טוקנים בנפח של כחמש מאות ג'יגה-בייט, שחולצו מתוך מאגר גולמי עצום של 240 טרה-בייט. הטקסטים נאספו משילוב של מקורות רשת יחד עם מידע ייעודי ואיכותי שנבחר ידנית. התוכן מחולק לקטגוריות מוגדרות: עיתונות ומאמרי דעה, מאמרים אקדמיים ודוחות מחקר, קוד מקור במגוון שפות תכנות, ספרים שכוללים ספרי לימוד, רומנים ושירה, וכן אנציקלופדיות, פורומים, חוקים ותקנות.

תהליך הניקוי של הנתונים התבסס על ארבעה שלבים עוקבים: נרמול הטקסט, סינון היוריסטי, ניקוי כפילויות רב-שלבי וסינון תכנים רעילים. בסיום הסינון הזה נותרו 10.6 טרה-בייט של מידע איכותי, ומתוכו נארזה הדגימה שפורסמה כאן לצורך אימון מודל השפה.

מתאים ל

  • אימון מקדים למודלי שפה

    בניית מודלי שפה רב-לשוניים מאפס שמתמקדים באיכות גבוהה בסינית ובאנגלית.

  • אימון מודלים לכתיבת קוד

    שימוש בחלק שכולל קוד מקור כדי לשפר יכולות הבנה וייצור תוכנה של המודל.

  • מחקר על סינון נתונים

    בדיקת השפעת תהליכי ניקוי ודחיסה מתוך מאגרי ענק של טקסט גולמי על ביצועי המודל.

איפה זה נופל

המאגר מתמקד כולו בשפות סינית ואנגלית בלבד, ואין בו שום נתונים בעברית. בנוסף, אף שהחוקרים ביצעו סינון רעילות וניקוי היוריסטי, כרטיס המאגר אינו חושף אילו מילים נחסמו, מהם החוקים שהוגדרו או מהו טווח התאריכים המדויק שבו הטקסטים נאספו. לפני שמשלבים את הנתונים באימון של מודל שפונה למשתמשים, חייבים לבדוק עצמאית את רמת ההטיות הפוליטיות, התרבותיות והחברתיות שקיימות בטקסטים המקוריים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

לא באופן ישיר וחופשי. בעוד שהקוד פתוח תחת רישיון Apache 2.0, הנתונים עצמם כפופים לרישיון YAYI 2 שדורש פנייה לאישור מסחרי במייל מול היוצרים והסכמה לתנאי הרישיון שלהם.

כמה מקום בדיסק צריך כדי להוריד את הנתונים?

החוקרים מציינים שנדרש נפח אחסון מקומי של יותר מ־500GB כדי להחזיק את הקבצים. המאגר מורכב מאלפי קבצים שמכילים יחד מעל מאה מיליארד טוקנים.

האם המאגר כולל טקסטים בעברית?

לא, המאגר מוגדר וממוקד אך ורק בשפות סינית ואנגלית. מי שמחפש מידע מקומי או טקסטים לאימון מודלים בעברית לא ימצא אותם כאן.

איך החוקרים סיננו את הנתונים הגולמיים?

התהליך התחיל מ־240 טרה-בייט של מידע גולמי מהרשת וממקורות מובחרים. הנתונים עברו ארבעה שלבי סינון של נרמול, בדיקות היוריסטיות, ניקוי כפילויות וסינון רעילות, עד שנותרו 10.6 טרה-בייט שמתוכם נדגמו הטקסטים שבמאגר.

איך טוענים

כדי להוריד ולטעון את הנתונים צריך להיערך עם שטח אחסון מקומי פנוי של מעל 500GB לפחות. המאגר מפוצל ל־5,208 קבצים, כך שמומלץ לעבוד עם מנגנון הורדה שתומך בחידוש במקרה של ניתוק ולא לנסות למשוך הכל בבת אחת לזיכרון העבודה. אין כאן תהליך אישור גישה מוקדם ב־Hugging Face, אבל לפני שטוענים את הטקסטים לתוך שלב הטוקניזציה צריך לבדוק את מבנה הרשומות המדויק בקבצים שנמשכו, כי הכרטיס אינו מפרט את שמות השדות המדויקים של הפורמט הגולמי.

from datasets import load_dataset

ds = load_dataset("wenge-research/yayi2_pretrain_data")

הרישיון

למרות שהמטא-דאטה מציג רישיון Apache 2.0, הטקסט של הכרטיס מבהיר שזה חל רק על הקוד. השימוש בנתונים עצמם כפוף לרישיון הקהילה של YAYI 2, ושימוש מסחרי במאגר או במודלים שנגזרו ממנו מחייב הגשת בקשה רשמית ואישור פרטני במייל מול החברה המפרסמת.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗