GPT
S

sangraha

קוד פתוח

ai4bharatcc-by-4.02024-03-05

  • language-modeling
  • casual-lm
  • llm

מאגר ענק לאימון מקדים של מודלי שפה ב־22 שפות הודיות ובאנגלית, בהיקף של 251B טוקנים. הוא משלב טקסטים מאומתים, נתונים שעברו סינון פרפלקסיטי ותרגומים בהיקף נרחב מוויקיפדיה.

  • 26,835הורדות בחודש
  • 83לייקים

מה זה

המאגר מחולק לשלושה חלקים עיקריים שמרכיבים יחד 251,321.0 מיליון טוקנים. החלק הראשון הוא Verified, הכולל 64,306.1 מיליון טוקנים שנאספו מאתרים שעברו אימות אנושי, חילוצי OCR מקבצי PDF באיכות גבוהה, ותמלולים של פודקאסטים, קורסים, סרטים וסרטונים בהודית ובאנגלית.

החלק השני הוא Unverified, המכיל 24,307.7 מיליון טוקנים שנשלפו מתוך מאגרי טקסט רב לשוניים קיימים. כדי לסנן את הטקסטים האלה, המפתחים השתמשו במודלי שפה מסוג n-gram שאומנו על המידע המאומת וביצעו סינון פרפלקסיטי כדי לנפות תוכן ירוד.

החלק השלישי הוא Synthetic, שהוא גם הגדול ביותר ומכיל 162,707.9 מיליון טוקנים. חלק זה מבוסס על ויקימדיה באנגלית שתורגמה ל־14 שפות הודיות, ובנוסף עברה תעתיק לאותיות לטיניות כדי לאפשר ייצוג פונטי באנגלית.

מתאים ל

  • אימון מקדים למודלי שפה

    בניית מודלי בסיס למשימות text-generation תוך שימוש ב־251B טוקנים בשפות הודיות שונות.

  • אימון ייעודי לשפה בודדת

    שליפת טקסטים מאומתים בשפה מסוימת כמו טמילית או הינדי לאימון ממוקד באמצעות הורדה לפי שפה.

  • מחקר על דאטה סינתטי

    הערכת ההשפעה של תרגום מכונה מוויקימדיה ותעתיק לטיני על איכות היצירה של מודלי שפה.

איפה זה נופל

החלק הארי של הטקסט במאגר, 162,707.9 מיליון טוקנים מתוך 251,321.0 מיליון, הוא חומר סינתטי שמקורו בתרגום מכונה של ויקימדיה מאנגלית, ולא טקסט שנכתב במקור על ידי דוברי השפות. זה עלול להכניס שגיאות תרגום וסגנון לא טבעי.

בנוסף, קיים פער קיצוני בחלוקה בין השפות השונות. שפות כמו brx, doi, kas ו־sat מכילות פחות מ־2 מיליון טוקנים כל אחת וללא ייצוג סינתטי בכלל, בעוד שפות כמו הינדי ובנגלי נהנות מעשרות אלפי מיליוני טוקנים. אין במאגר עברית כלל.

שאלות
נפוצות

האם מותר להשתמש במאגר למוצרים מסחריים?

כן. הרישיון הוא cc-by-4.0, שמתיר שימוש מסחרי מלא באימון מודלים ופיתוח מוצרים, בתנאי שאתם מעניקים קרדיט ליוצרים ומצטטים את הפרסום שלהם.

האם יש במאגר טקסטים בעברית?

לא. המאגר מיועד אך ורק ל־22 שפות הודיות ולאנגלית, ואין בו נתונים בעברית בכלל.

מה ההבדל בין שלושת החלקים במאגר?

החלק המאומת כולל טקסטים מאתרים שנבדקו, קבצי PDF ותמלולי וידאו. החלק הלא מאומת מגיע ממאגרים רב לשוניים וסונן באמצעות מדדי שפה, והחלק הסינתטי נוצר מתרגום ויקימדיה האנגלית ל־14 שפות הודיות.

האם חובה להוריד את כל 2,545 הקבצים?

לא. אפשר להגדיר בפקודת הטעינה את תיקיית היעד המדויקת וכך להוריד רק תת מאגר מסוים או שפה בודדת מתוכו.

איך טוענים

הטעינה נעשית דרך ספריית datasets של Hugging Face באמצעות קריאה לפקודה load_dataset עם מזהה המאגר ai4bharat/sangraha. המאגר כולו פתוח לגישה ציבורית ללא צורך באישור מוקדם, והוא בנוי מ־2,545 קבצים בפורמט parquet.

הורדת המאגר כולו דורשת משאבים כבדים מאוד, אך הפקודה תומכת בפרמטר data_dir שמאפשר למשוך רק תת מאגר ספציפי כמו verified, או שפה בודדת מתוך תת מאגר מסוים כמו verified/asm.

from datasets import load_dataset

ds = load_dataset("ai4bharat/sangraha")

הרישיון

המאגר מופץ תחת רישיון cc-by-4.0. הרישיון הזה מתיר שימוש חופשי לחלוטין, כולל שימוש מסחרי, מחקרי, שינוי הנתונים ואימון מודלים, ללא חובה לשתף את התוצרים באותו רישיון. הדרישה היחידה היא מתן קרדיט מתאים ליוצרי המאגר מ־AI4Bharat וציטוט המאמר שלהם כפי שמפורט בתיעוד.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗