GPT
I

IndicVault

קוד פתוח

maya-researchmit2025-05-06

מאגר שאלות ותשובות ממוקד שפות הודיות בסגנון דיבור יומיומי ולא פורמלי. הוא פותר את בעיית הנוקשות של טקסטים מתורגמים כשבונים בוטים או סוכני קול להודו.

  • 95הורדות בחודש
  • 70לייקים

מה זה

הנתונים מחולקים לפי שפות וכוללים הינדי, טלוגו והינגליש, סביב 80,000 זוגות שאלות ותשובות לכל שפה. כל רשומה כוללת שאלה של משתמש ותשובה מפורטת שמנוסחת בסלנג מקומי, תוך ערבוב מילים מאנגלית בתעתיק לכתב המקומי ולא באותיות לטיניות. המטרה היא דיבוב טבעי במערכות קוליות.

התוכן מכסה עשרים קטגוריות שונות, כולל פיננסים, בריאות, טכנולוגיה, קריירה, חקלאות ופוליטיקה. בכרטיס לא מצוין מאיפה בדיוק נאספו הטקסטים המקוריים או באיזה אופן בוצע הסינון, מעבר להצהרה שהם נכתבו או נערכו כדי לשקף את צורת הדיבור של שנת 2025. החלוקה הפיזית במאגר מתבססת על קבצים נפרדים לכל שפה.

מתאים ל

  • אימון בוטים לשירות בהודו

    התאמת מודלי שפה לשיחה קולחת ויומיומית מול משתמשים דוברי הינדי וטלוגו בלי ניסוחים נוקשים.

  • הכנת טקסט לסוכני קול

    הפקת תשובות שמשלבות אנגלית בכתב מקומי, מה שמקל על מנועי הקראת טקסט הודיים להישמע אמינים.

  • הערכת מודלים בשפות מקומיות

    בדיקת יכולת המודל להתמודד עם סלנג, שאלות על תקציב אישי וביטויים מעורבבים מעשרים תחומים שונים.

איפה זה נופל

אם אתם מחפשים תמיכה בעברית, אין פה מילה אחת. המאגר מוגבל אך ורק להינדי, טלוגו והינגליש. מעבר לזה, הכרטיס לא מספק תיעוד על מקורות הנתונים, ולכן קיים סיכון ממשי להזיות, עובדות לא בדוקות או הטיות תרבותיות ופוליטיות שלא עברו ביקורת קפדנית. חובה לסנן את התשובות בנושאי בריאות, חוק ופיננסים לפני שמחברים את המודל ללקוחות אמיתיים.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט הזה במוצר מסחרי?

כן, המאגר פורסם ברישיון אם איי טי פתוח. הרישיון מאפשר לאמן מודלים לשימוש מסחרי חופשי ולמכור שירותים שמבוססים עליהם. הדרישה היחידה היא לצרף את תנאי הרישיון והקרדיט המקורי.

האם יש במאגר נתונים בעברית?

לא, המאגר מיועד ספציפית לשפות הודיות וכולל רק הינדי, טלוגו ושילוב הינגליש. הוא לא יועיל בשום צורה למשימות בעברית.

מאיפה הגיע המידע שבתוך הקבצים?

הכרטיס הרשמי אינו מפרט את מקורות המידע או את תהליך הסינון שבוצע. היוצרים רק מציינים שהשאלות והתשובות נערכו כך שיתאימו לסגנון הדיבור העדכני של שנת 2025, ולכן מומלץ לבדוק מדגמית את אמינות הנתונים.

מה מייחד אותו מדאטהסטים אחרים בהינדי?

רוב המאגרים מציעים טקסט ספרותי, רשמי או מתורגם ישירות מאנגלית שנשמע מלאכותי. כאן התשובות כתובות בסגנון דיבור יומיומי, תוך שימוש במילים באנגלית שנכתבות ישירות באותיות של השפה המקומית כדי שיתאימו למערכות שמע.

איך טוענים

טוענים את המידע ישירות מספריית הדאטהסטס או בקריאת קובצי גייסון מקומיים. המאגר פתוח לציבור ואין צורך לבקש אישור גישה מיוחד מיוצריו. במאגר יש חמישה קבצים, כאשר המרכזיים שבהם מחולקים לפי שמות השפות כמו הינדי וטלוגו.

המבנה הפנימי בכל קובץ פשוט מאוד ומכיל שני שדות בלבד, שאלות ותשובות, תחת המפתחות שאלה ותגובה. לפני שמתחילים אימון, חשוב לוודא שהטוקנייזר שלכם תומך היטב בכתב דוונגארי ובכתב טלוגו, כי מילים שאולות באנגלית מופיעות באותיות הודיות מקומיות ולא בכתב לטיני.

from datasets import load_dataset

ds = load_dataset("maya-research/IndicVault")

הרישיון

המאגר מופץ תחת רישיון אם איי טי חופשי. מותר להשתמש בו לצרכים מסחריים ומחקריים, לשנות אותו, לאמן עליו מודלים ולשלב אותם במוצרים סגורים. התנאי היחיד הוא שמירת הודעת זכויות היוצרים המקורית של היוצרים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗