GPT
M

MSMARCO-XI

קוד פתוח

ai4bharatרישיון לא דווח2025-05-28

תרגום של מאגר MS MARCO ל־14 שפות הודיות שונות לצד מקור באנגלית. החומר מיועד למי שמפתח ומעריך מערכות RAG ומודלים לשליפת מידע עבור תת-היבשת ההודית.

  • 25,616הורדות בחודש
  • 28לייקים

מה זה

המאגר מבוסס על משימות הבנת הנקרא ושאלות ותשובות מתוך MS MARCO המוכר, כשהתוכן האנגלי תורגם לשפות אזוריות בהודו. כל רשומה מחזיקה שאילתת חיפוש, תשובה וקטעי טקסט, כאשר לצד הגרסה המתורגמת נשמרים המקור באנגלית, סוג השאילתה, מזהה מספרי וסימון של הקטעים הרלוונטיים שנבחרו.

התרגומים נעשו באמצעות מודלי שפה, והרשומות כוללות מטא-דאטה טכני מלא על תהליך ההפקה: שם המודל המתורגם, שפות המקור והיעד, ופרמטרי הדגימה שבהם השתמשו לייצור הטקסט, כולל טמפרטורה, טופ-פי ועונשי תדירות ונוכחות.

הנתונים מחולקים לפי 14 שפות יעד ובהן הינדי, בנגלית, טמילית, טלוגו, אורדו וסנסקריט. עבור כל שפה קיימת חלוקה מוגדרת מראש של קובצי אימון וקובצי ולידציה, מה שחוסך חיתוך ידני של החומר לפני תחילת העבודה.

מתאים ל

  • אימון RAG רב-לשוני

    בנייה והתאמה של מערכות RAG לשליפת פסקאות ומענה על שאלות בשפות הודיות שונות.

  • בנצ'מרק למודלי שליפה

    הערכת ביצועים של מנועי חיפוש דקדוקיים ווקטוריים בשפות כמו הינדי, בנגלית וטמילית.

  • אימון מודלי תרגום ייעודיים

    שימוש בזוגות השאילתות והתשובות באנגלית ובשפות היעד לצורך כוונון מודלי תרגום מכונה.

איפה זה נופל

התוכן המתורגם נוצר במכונה ולא עבר תיקוף אנושי מדווח, כך שהוא כולל בהכרח שגיאות תרגום, הזיות וניסוחים מלאכותיים שמאפיינים מודלי שפה. שנית, אין כאן עברית כלל. הפרויקט ממוקד בלעדית בשפות הודיות. בנוסף, מאחר שמדובר בתרגום ישיר של שאילתות וקטעים מערביים במקור, הידע וההקשר התרבותי אינם משקפים בהכרח מציאות מקומית של דוברי השפות האלו.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מסחרי?

הרישיון אינו מוגדר בעמוד ואין היתר מפורש למסחר. המפרסמים מפנים לרישיון המקורי של MS MARCO, ולכן צריך לבדוק את התנאים של מיקרוסופט לפני שימוש כזה. שימוש מסחרי ללא בירור כרוך בסיכון משפטי.

האם יש במאגר נתונים בעברית?

לא, אין כאן עברית בכלל. המאגר מיועד ספציפית ל־14 שפות הודיות נבחרות לצד האנגלית המקורית. אם הפרויקט שלכם דורש עברית, תצטרכו לפנות למאגרים אחרים.

איך נאספו ונוצרו הנתונים?

הבסיס הוא השאילתות, התשובות והפסקאות ממאגר MS MARCO הקיים. החוקרים הריצו את הטקסט דרך מודל שפה לצורך תרגום אוטומטי, ותיעדו ברשומות את פרמטרי הריצה של המודל.

באיזה אופן הנתונים מאורגנים להורדה?

המאגר מכיל 30 קבצים הכוללים קובצי פרקט לפי שפה וסקריפט טעינה. ניתן למשוך רק את השפה הרלוונטית לעבודה שלכם דרך הספרייה הרגילה, מבלי להוריד את כל השפות האחרות.

איך טוענים

טוענים את החומר ישירות דרך ספריית datasets של Hugging Face בפקודת load_dataset, תוך ציון המזהה של המאגר, קוד השפה הרצויה כמו hi או bn, ושם החלק. הגישה פתוחה ואינה דורשת אישור מראש. במאגר שמורים קובצי parquet לצד הפניות לפורמט jsonl, והשדות העיקריים שבהם תשתמשו לשליפה ולאימון הם query, Answer, ורשימות הפסקאות תחת passages.

from datasets import load_dataset

ds = load_dataset("ai4bharat/MSMARCO-XI")

הרישיון

בעמוד המאגר לא דווח רישיון מפורש, והיוצרים מפנים לתנאי הרישיון המקוריים של MS MARCO. בפועל, המשמעות היא אי-ודאות משפטית לגבי שימוש מסחרי, ייחוס נדרש וזכויות יוצרים על התרגומים הסינתטיים. לפני אימון מודל לצורכי מסחר או שילובו במוצר, חובה לאתר ולבדוק את תנאי הרישיון של המאגר המקורי מבית מיקרוסופט.

הרישיון המלא ב־Hugging Face ↗