GPT
S

samanantar

קוד פתוח

ai4bharatcc-by-nc-4.02022-03-02

  • conditional-text-generation

מאגר ענק של 49.6 מיליון זוגות משפטים מקבילים בין אנגלית ל־11 שפות הודיות. הוא נבנה במיוחד לאימון והערכה של מודלי תרגום מכונה ויצירת טקסט.

  • 2,530הורדות בחודש
  • 44לייקים

מה זה

המאגר כולל זוגות משפטים מקבילים, כאשר שפת המקור היא תמיד אנגלית ושפת היעד היא אחת מתוך 11 שפות הודיות: אסאמית, בנגלית, גוג'ראטית, הינדי, קנאדה, מליאלאם, מראטהי, אודיה, פנג'אבי, טמילית וטלוגו. כל רשומה כוללת מזהה מספרי, את משפט המקור באנגלית, את משפט היעד המתורגם, ואת שם המקור שממנו נלקח הטקסט.

הנתונים מגיעים ממגוון רחב של מקורות אינטרנטיים, אתרי חדשות גדולים בהודו, גופי שידור, פלטפורמות חינוכיות כמו קורסרה וחאן אקדמי, ערכי ויקיפדיה, ומאגרי מידע ממשלתיים. החלוקה במאגר מתבצעת לפי שפות היעד, כאשר לכל שפה מוקצים קבצים ייעודיים בהתאם לגודל הנתונים שנאספו עבורה.

מתאים ל

  • אימון מודלי תרגום

    אימון מודלים לתרגום ישיר בין אנגלית לשפות הודיות שונות על בסיס טקסטים מקבילים.

  • הערכת ביצועי מודלים

    בדיקת איכות תרגום ויצירת טקסט של מודלים קיימים מול נתונים ממקורות חדשותיים וחינוכיים.

  • מחקר בלשני חישובי

    ניתוח השוואתי של מבנים תחביריים ומאפיינים לשוניים בין אנגלית למשפחות שפות בהודו.

איפה זה נופל

כרטיס הנתונים משאיר חוסר מידע משמעותי לגבי תהליך הסינון, הניקוי, ובדיקות הפרטיות או המידע הרגיש. חלק ניכר מהנתונים נסמך על אתרי חדשות ותכנים ממשלתיים, מה שיוצר הטיה מובנית לתחומי אקטואליה ופוליטיקה ושפה רשמית יותר. בנוסף, חלוקת הקבצים מעידה על פערים בכמויות המידע בין השפות השונות, למשל קובץ בודד באסאמית לעומת חמישה בבנגלית.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא. הרישיון הוא cc-by-nc-4.0, מה שאוסר שימוש מסחרי מכל סוג. הוא מתאים למחקר אקדמי ולבדיקות בלבד.

האם המאגר כולל עברית?

לא. המאגר מתמקד אך ורק בזוגות שפות בין אנגלית ל־11 שפות הודיות מובילות, ואין בו שום תוכן בעברית.

מאיפה הנתונים הגיעו בפועל?

הטקסטים נאספו מעשרות מקורות רשת שונים. ביניהם אתרי חדשות כמו אינדיאן אקספרס וטיימס אוף אינדיה, גופי שידור, ויקיפדיה, ואתרים חינוכיים כמו קורסרה.

איך המידע מסודר בקבצים?

המאגר מורכב מ־36 קבצי פרקט המחולקים לפי שפת היעד. לכל שפה יש תיקייה משלה עם קובץ אחד או יותר, בהתאם להיקף הזוגות שנאספו לאותה שפה.

איך טוענים

המאגר מחולק ל־36 קבצי פרקט המאורגנים בתיקיות לפי קוד השפה, ללא צורך באישור גישה מיוחד. בגלל שמדובר בעשרות מיליוני רשומות, מומלץ לטעון רק את שפת היעד הספציפית שמעניינת אתכם ולא את כל התיקיות יחד. השדות העיקריים לעבודה הם src למקור באנגלית ו־tgt לשפת היעד, לצד data_source שימושי לסינון איכות לפי מקור הטקסט.

from datasets import load_dataset

ds = load_dataset("ai4bharat/samanantar")

הרישיון

המאגר מופץ תחת רישיון cc-by-nc-4.0. המשמעות ברורה וחד משמעית: אסור לחלוטין להשתמש בנתונים האלה למטרות מסחריות. השימוש מוגבל למחקר, ניסויים ופיתוח פנימי בלבד, תוך מתן קרדיט מתאים. אם אתם מתכננים לאמן מודל שיוטמע במוצר מסחרי, לא תוכלו להשתמש במאגר הזה.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗