GPT
L

language-identification

קוד פתוח

papluca2022-03-02

המאגר מרכז 90 אלף פסקאות טקסט שמתוייגות לפי 20 שפות שונות בחלוקה שווה לגמרי. הוא מתאים למי שרוצה לאמן או לבחון מסווג שפה בסיסי בלי להסתבך עם חוסר איזון בין קבוצות.

  • 1,746הורדות בחודש
  • 70לייקים

מה זה

הנתונים מורכבים מטקסטים קצרים ומתג השפה שלהם, ללא מטא-דאטה נוסף. המקורות הם שלושה מאגרים מוכרים: ביקורות מוצרים מאמזון, קורפוס ההיקש הלוגי XNLI, ותרגומי מדד הדמיון STSb Multi MT. השילוב הזה מייצר תערובת של שפת כתיבה יומיומית מביקורות לצד משפטים תקניים ממבחני הערכה.

המבנה מחולק לשלושה חלקים מאוזנים לחלוטין. קובץ האימון כולל 70 אלף דוגמאות, בדיוק 3,500 משפטים לכל שפה. קובץ הוולידציה וקובץ המבחן מכילים 10 אלף דוגמאות כל אחד, עם 500 משפטים לכל שפה. הדגימה הזו מבטיחה שהמודל לא ייטה מראש לשפה נפוצה כמו אנגלית רק בגלל כמות המידע.

מתאים ל

  • אימון מזהה שפה

    בניית מודל קל משקל לזיהוי 20 השפות הנתמכות עבור ניתוב טקסטים במערכות רב-לשוניות.

  • בנצ'מרק לסיווג מאוזן

    בדיקת ביצועים של ארכיטקטורות טקסט שונות על חלוקה שווה ומדויקת בין מחלקות.

  • סינון קלט רב-לשוני

    אימות שפת המשתמש בממשקים בינלאומיים לפני שליחה למודלי שפה גדולים.

איפה זה נופל

הבעיה הבולטת ביותר לקורא המקומי היא היעדרותה המוחלטת של השפה העברית מרשימת 20 השפות. בנוסף, הכרטיס מציין שההטיות הקיימות נגזרות ישירות משלושת מאגרי המקור, אך אינו מפרט מהן. טקסטים שמגיעים מביקורות מוצרים וממבחני NLP מתורגמים אינם מייצגים שפה חופשית ברשת, ניבים מקומיים, סלנג עכשווי או שגיאות הקלדה טיפוסיות, ולכן סיווג של טקסטים קצרים ומבולגנים עלול להיכשל.

שאלות
נפוצות

האם המאגר כולל טקסטים בעברית?

לא, המאגר כולל 20 שפות בלבד ועברית אינה אחת מהן. השפות הנתמכות כוללות שפות נפוצות כמו אנגלית, ספרדית, ערבית, סינית, רוסית וגרמנית. אם אתם חייבים זיהוי שפה שכולל עברית, תצטרכו להוסיף דוגמאות ממקור אחר או לבחור קורפוס שונה.

האם מותר להשתמש בדאטהסט לפיתוח מוצר מסחרי?

הכרטיס הרשמי משאיר את שדה הרישיון ריק ולכן אין אישור שימוש מפורש. בנוסף, חלק מהנתונים נאספו מביקורות אמזון ומקורות בעלי תנאים משלהם. במצב כזה, אימון מודל מסחרי עלול לחשוף אתכם לבעיות של זכויות יוצרים.

מאיפה נאספו הטקסטים והאם יש בהם פרטים אישיים?

המידע מבוסס על שלושה מקורות מוכרים: קורפוס הביקורות הרב-לשוני של אמזון, XNLI ו־STSb Multi MT. לפי יוצרי המאגר, הטקסטים אינם מכילים פרטים מזהים או מידע רגיש על הכותבים. העבודה נעשתה במסגרת אירוע קהילתי של Hugging Face בסוף שנת 2021.

כמה דוגמאות יש בכל שפה והאם הפיצול מאוזן?

המאגר מאוזן בצורה מושלמת בין 20 השפות לאורך כל החלקים שלו. סט האימון כולל בדיוק 3,500 דוגמאות לכל שפה, ובסטים של הבדיקה והוולידציה יש 500 דוגמאות לכל שפה. האיזון הזה מונע צורך בטכניקות של דגימת יתר או שקלול משקלים בזמן האימון.

איך טוענים

המאגר ציבורי ופתוח להורדה ישירה בלי צורך בהרשאות גישה או אישור מיוחד. הנתונים מגיעים בקובצי CSV פשוטים שמחולקים מראש לקובצי אימון, ולידציה ובדיקה. כל רשומה כוללת רק שני שדות, טקסט ותווית שפה, כך שטעינה בספריית datasets דורשת שורת קוד אחת ואינה דורשת עיבוד מקדים כבד.

from datasets import load_dataset

ds = load_dataset("papluca/language-identification")

הרישיון

היוצר לא ציין שום רישיון בכרטיס המאגר. מבחינה משפטית, היעדר רישיון מוגדר משאיר את זכויות השימוש מעורפלות לחלוטין, במיוחד בגלל שהטקסטים נלקחו ממאגרים חיצוניים כמו אמזון. אם אתם מתכננים להשתמש בזה למוצר מסחרי, מדובר בסיכון שאי אפשר להתעלם ממנו עד שהיוצר יבהיר את תנאי השימוש.

הרישיון המלא ב־Hugging Face ↗