GPT
G

GlotCC-V1

קוד פתוח

cis-lmucc0-1.02024-05-29

  • multilingual

קורפוס ענק שמביא טקסטים מאורגנים לפי שפה וכתב עבור מאות שפות שונות, כולל שפות דלות משאבים. הוא מתאים למי שבונה מודל שפה רב לשוני וצריך כיסוי רחב תחת נחלת הכלל ללא מגבלות מסחריות.

  • 2,688הורדות בחודש
  • 61לייקים

מה זה

המאגר מכיל קובצי טקסט שמחולקים לפי צמדים של שפה וסוג כתב, כמו עברית בכתב עברי או שפות אזוריות באלפבית לטיני וקירילי. הנתונים מאורגנים בתיקיות ייעודיות לכל שילוב, מה שמאפשר לגשת ישירות רק לשפה שמעניינת אתכם בלי לפרוק את כל השאר. המבנה מבוסס על חלוקה אחת בלבד של אימון, ללא סטים מובנים להערכה או לבדיקה.

מקור הטקסטים המדויק, אופן האיסוף שלהם מהרשת ותהליכי הסינון שעברו אינם מפורטים בתיעוד שצורף למאגר. לא נמסר מידע על סינון תכנים פוגעניים, ניקוי רעשי HTML או הסרת כפילויות, כך שאיכות הנתונים בכל שפה נשארת לא ידועה מראש. מי שמתכנן להסתמך עליהם יצטרך לבצע בדיקה וניקוי עצמאיים על הדגימות לפני שמתחילים לאמן.

מתאים ל

  • אימון מודלי שפה רב לשוניים

    אימון מקדים של מודלים הזקוקים לטקסט מגוון במאות שפות וכתבים שונים.

  • זיהוי שפה וכתב

    בניית מסווגים מהירים שמבדילים בין שפות נדירות לבין סוגי אלפבית שונים.

  • חילוץ נתונים ממוקד

    שליפת קובצי פרקט של שפה בודדת מתוך המאגר לצורך עיבוד לשוני מקומי.

איפה זה נופל

התיעוד אינו מציין מתי הטקסט נאסף, מהם המקורות שלו או אילו הטיות קיימות בתוכו. חוסר המידע על בקרת האיכות אומר שאתם עלולים להיתקל בכפילויות, בטקסט שבור או בהזיות תרגום מכונה בשפות פחות נפוצות. בנוסף, אין חלוקה מובנית למבחן, כך שלא ניתן לבצע הערכה נקייה בלי לחתוך נתונים לבד.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

כן. הרישיון המדווח הוא נחלת הכלל, מה שמאפשר שימוש מסחרי חופשי לחלוטין. אין שום דרישה למתן קרדיט או לשחרור המודל המאומן בקוד פתוח.

האם יש במאגר טקסטים בעברית?

כן. קיימת תצורה ייעודית של עברית בכתב עברי שניתן לטעון בנפרד. בנוסף קיימות תצורות לטקסטים קרובים כמו יידיש או עברית מקראית.

איך הנתונים נאספו ומאיפה הם הגיעו?

הכרטיס אינו מספק מידע על מקורות הטקסט או שיטות האיסוף והסינון. מומלץ לבדוק ידנית את איכות הטקסט בשפה שלכם לפני שמתחילים להשתמש בו.

האם חייבים להוריד את כל אלפי הקבצים במאגר?

ממש לא. הקבצים מחולקים לפי שפות וכתבים, וניתן להוריד רק את התצורה של השפה הרצויה במקום את כל המאגר המלא.

איך טוענים

טוענים את המאגר ישירות דרך ספריית הדאטהסטים של הפינג פייס. אין צורך לבקש אישור גישה מוקדם או להתחבר לחשבון מיוחד. המאגר מורכב ממעל אלפיים וחמש מאות קבצים בפורמט פרקט, ומכיל עשרות תצורות שונות לפי שפה ואלפבית. מומלץ מאוד לא להוריד את הגדרת ברירת המחדל הכוללת את כלל השפות, אלא להגדיר במפורש את התצורה המבוקשת, למשל עברית או אנגלית, כדי לחסוך זמן הורדה ושטח אחסון יקר.

from datasets import load_dataset

ds = load_dataset("cis-lmu/GlotCC-V1")

הרישיון

המאגר מפורסם תחת רישיון פתוח לחלוטין מסוג נחלת הכלל. מותר להשתמש בטקסטים לכל מטרה, כולל מוצרים מסחריים ואימון מודלים קנייניים, בלי חובת ייחוס ובלי דרישה לשתף את התוצרים ברישיון זהה.

הרישיון המלא ב־Hugging Face ↗