GPT
G

Glot500

קוד פתוח

cis-lmuother2023-11-01

  • multilingual

מאגר טקסטים עצום שמכסה מאות שפות וניבים נדירים לצד שפות מרכזיות. מיועד למי שבונה או בודק מודלי שפה וזקוק לכיסוי רב לשוני רחב במיוחד.

  • 9,933הורדות בחודש
  • 43לייקים

מה זה

המאגר כולל טקסטים בחלוקה למאות תצורות שונות לפי שפה ואלפבית, כאשר כל תצורה מוגדרת לפי קוד שפה וכתב כמו עברית, יידיש, ערבית, לטינית או קירילית. המבנה הפנימי מאורגן בקבצי חלוקה של אימון בלבד, ללא פיצול מובנה למבחן או ולידציה. לפי מבנה הקבצים, כל שפה מחזיקה קובצי נתונים בפורמט חץ לצד מטא דאטה בקובצי הגדרות ייעודיים.

כרטיס הנתונים מציין רק את רשימת התצורות והקבצים, אך לא מפרט את מקורות הטקסט הגולמיים, תהליכי הניקוי, הסינון או אופן דגימת המשפטים מתוך המקורות. המשמעות היא שאין תיעוד לגבי השאלה האם מדובר בטקסטים שנאספו מתוך אתרי אינטרנט, תרגומים דתיים, ספרים או מאגרים ממשלתיים, ולכן איכות התוכן בכל ניב דורשת בדיקה מדגמית ידנית לפני שמתחילים לעבוד.

מתאים ל

  • אימון מקדימי רב לשוני

    הרחבת אוצר מילים של מודלי שפה עבור ניבים נדירים ושפות בעלות משאבים נמוכים.

  • זיהוי שפה וכתב

    בניית מסווגים לזיהוי שפות מגוונות ואלפביתים שונים מתוך טקסטים קצרים.

  • מבחני הכללה לשונית

    בדיקת יכולת המודל להתמודד עם שפות שאינן מיוצגות היטב ברשת.

איפה זה נופל

הכרטיס לא מדווח על מקורות המידע, תאריכי הדגימה או שיטות הסינון, ולכן אי אפשר לדעת מהי מידת הרעש, ההטיות התרבותיות או המידע המיושן בכל תצורה. חסרה חלוקת הערכה רשמית. בנוסף, רבות מהשפות כוללות ייצוגים אזוריים מאוד ספציפיים בלי הסבר על נפח המילים הזמין בפועל.

שאלות
נפוצות

האם המאגר כולל עברית?

כן, המאגר כולל תצורות של עברית וכן עברית מקראית ויידיש. כל אחת מהן יושבת תחת קוד שפה וכתב נפרד בארכיון.

האם מותר להשתמש בו למוצר מסחרי?

הרישיון מוגדר בתור אחר ומפנה לקובץ בתוך המאגר. צריך לבדוק את התנאים בקובץ עצמו לפני כל שימוש עסקי או הפצת מודל.

איך מחלקים את הנתונים לאימון ובדיקה?

המאגר מגיע עם תיקיות אימון בלבד עבור כל שפה. עליכם לפצל את הנתונים באופן ידני בקוד כדי לייצר קבוצת בדיקה וולידציה.

איך טוענים

טוענים תצורה מסוימת לפי שם השפה והכתב שלה, למשל עברית או יידיש, באמצעות פקודת הטעינה הסטנדרטית של ספריית הנתונים של הגינג פייס. הגישה למאגר פתוחה ישירות ללא צורך בהרשאה מיוחדת. הנתונים שמורים כקבצי חיצי זיכרון ומחולקים לתיקיות אימון בלבד. אם תרצו לאמן או לבדוק ביצועים, תצטרכו להגדיר פיצול עצמאי למבחן מתוך הנתונים.

from datasets import load_dataset

ds = load_dataset("cis-lmu/Glot500")

הרישיון

הרישיון מוגדר בתור אחר ומפנה לקובץ רישיון פנימי במאגר. כל עוד לא קראתם את הקובץ הספציפי, אי אפשר להניח שימוש מסחרי חופשי או לדעת אילו הגבלות ייחוס ושיתוף חלות על תוצרי מודלים שמאומנים עליו.

הרישיון המלא ב־Hugging Face ↗