GPT
I

IndustryCorpus

קוד פתוח

BAAIapache-2.02024-07-10

טקסטים מקצועיים לסינון ואימון מודלים לפי 18 ענפים שונים, מחולקים לאנגלית וסינית. הוא רלוונטי למי שבונה מודל ייעודי לתחום מסוים ולא רוצה לאסוף ולסנן קורפוס גולמי בעצמו.

  • 4,478הורדות בחודש
  • 61לייקים

מה זה

המאגר מכיל כ־3.4 טרה-בייט של נתונים שנבררו מתוך יותר מ־100 טרה-בייט של מקורות פתוחים קיימים, ביניהם WuDaoCorpora, BAAI-CCI, SkyPile-150B ו־redpajama. החלוקה הלשונית עומדת על 2.4 טרה-בייט באנגלית ועוד טרה-בייט אחד בסינית. החומרים עברו ניקוי דרך 22 אופרטורים שכללו המרת סינית מסורתית, ניקוי כתובות רשת, מיילים ו־IP, תיקוני יוניקוד, והסרת כפילויות ברמת המסמך באמצעות MinHash.

הטקסטים ממוינים ל־18 תחומים שונים, כשהחלוקה אינה שווה כלל. תחום החדשות מוביל עם 564.1 גיגה-בייט, חינוך עם 458.1 גיגה-בייט וספורט עם 442 גיגה-בייט, בעוד תחומים כמו תכנות עם 4.1 גיגה-בייט, בינה מלאכותית עם 5.6 גיגה-בייט ומתמטיקה עם 5.9 גיגה-בייט זכו לנפח זעום. הטקסטים בסינית כוללים גם תיוג איכות של 12 מאפיינים שונים, דוגמת מדדי פרפלקסיטי, אורך שורה ויחס תווים רעילים.

מתאים ל

  • אימון מודל לתחום הרפואה

    189 גיגה-בייט של טקסט רפואי מסונן באנגלית ובסינית, המשמשים להמשך אימון קדם של מודלים ייעודיים.

  • התאמת מודלים לעולם המשפט

    שימוש ב־274 גיגה-בייט של חומרים משפטיים מוכנים כדי לשפר דיוק של מודל שפה בניתוח מסמכים.

  • אימון מודלים לחינוך

    בניית מאגרי ידע וסיווג למערכות למידה על בסיס כ־458 גיגה-בייט של תוכן חינוכי שעבר ניקוי.

איפה זה נופל

המאגר מוגבל אך ורק לשפות אנגלית וסינית, ואין בו שום תוכן בעברית. הסיווג לענפים התבסס על מודל שפה עם דיוק מדווח של 80% בלבד, מה שאומר שחמישית מהחומרים עלולים לשבת בקטגוריה הלא נכונה. בנוסף, חוסר האיזון בין הקטגוריות קיצוני, כך שאם אתם בונים מודל לקוד או למתמטיקה, כמעט ואין לכם מה לחפש כאן. תיוג האיכות המפורט קיים בחלק הסיני בלבד, כך שבנתונים באנגלית תצטרכו לבצע בדיקות איכות ורעילות בעצמכם.

שאלות
נפוצות

האם הדאטהסט כולל טקסטים בעברית?

לא. המאגר מכיל רק תוכן באנגלית ובסינית שנאסף מפרויקטים כמו WuDao ו־redpajama. אם אתם מחפשים לאמן מודל שמבין עברית מקצועית, תצטרכו לאסוף מקורות אחרים.

האם מותר להשתמש בו למוצר מסחרי?

כן, הרישיון המוצהר הוא Apache 2.0 שמתיר שימוש מסחרי, אימון מודלים והפצה. התנאי היחיד הוא שמירה על תנאי הרישיון ומתן ייחוס ליוצרים.

כמה שוקל כל המאגר והאם חובה להוריד את כולו?

הנפח הכולל עומד על כ־3.4 טרה-בייט, מתוכם 2.4 טרה באנגלית וטרה בסינית. אין חובה להוריד הכל, אפשר להוריד קבצים בודדים של ענף ספציפי מתוך 1,305 הקבצים הדחוסים.

איך ביצעו את החלוקה לקטגוריות השונות?

הסיווג התבצע באמצעות מודל שפה ייעודי שהגיע לדיוק של 80%. המשמעות היא שחלק מהטקסטים יושבים תחת ענף שאינו מתאים להם בדיוק וכדאי לסנן אותם בעצמכם.

איך טוענים

הנתונים מחולקים ל־1,305 קבצים דחוסים בפורמט jsonl.gz, המאורגנים בתיקיות לפי שפה וענף מקצועי, למשל תיקיית en/agri. אין צורך בבקשת גישה מיוחדת או באישור של המפתח כדי להתחיל להוריד, פשוט מושכים את הקבצים ישירות מהמאגר. בגלל נפח כולל של מעל שלושה טרה-בייט, אין טעם לנסות להוריד את הכל למחשב המקומי. כדאי לעבוד ישירות מול שרת עם אחסון מהיר, להוריד רק את התיקיות של הענפים הרלוונטיים עבורכם, ולפרוס אותן בזמן אמת בצינור הנתונים. בחלק הסיני כדאי לשים לב לשדות המטא-דאטה הנוספים של דירוג האיכות וציוני השפה כדי לסנן מראש טקסטים בעייתיים.

from datasets import load_dataset

ds = load_dataset("BAAI/IndustryCorpus")

הרישיון

המאגר מופץ תחת רישיון Apache 2.0. הרישיון הזה מתיר שימוש מסחרי מלא, שינוי של הנתונים ושילוב שלהם במוצרים מסחריים בלי לחייב אתכם לחשוף את הקוד או את המודל שתאמנו. הדרישה העיקרית היא הכללת עותק של הרישיון המקורי ומתן קרדיט ליוצרים. עם זאת, מאחר שהנתונים נאספו ממאגרים פתוחים שונים ברשת, האחריות על זכויות היוצרים של הטקסטים המקוריים עצמם נשארת אצל המשתמש.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗