GPT
E

embed-nemotron-dataset-v1

קוד פתוח

nvidiaרישיון לא דווח2025-12-22

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

אוסף נתונים של אנבידיה לאימון מודלי שיקוע ואיחזור טקסט, המשלב דוגמאות מרובות שפות עם שליליים קשים מנומקים. הוא מרכז 14 מאגרי כיול מובילים במקום אחד עבור מערכות חיפוש וסיווג.

  • 498הורדות בחודש
  • 111לייקים

מה זה

המאגר כולל 14 תת מאגרים המחולקים בעיקר למשימות איחזור מידע וסיווג טקסט, עם 3,662,695 שאילתות ומעל 9 מיליון מסמכים. המבנה מורכב מנתונים ציבוריים מוכרים כמו MS MARCO, HotpotQA, SQuAD, MIRACL ו־FEVER, לצד נתונים סינתטיים ייעודיים כמו SyntheticClassificationData שנוצרו כדי לגוון משימות סיווג. איסוף המידע נעשה בשילוב של מקורות אנושיים, אוטומטיים וסינתטיים.

המבנה הפנימי בכל חלק מופרד לשני קבצים עיקריים, שאילתות ומאגר מסמכים. השאילתות כוללות מזהה, טקסט השאילתה, שיוך למאגר, ורשימות מסודרות של מסמכים חיוביים ומסמכים שליליים שנבחרו בתהליך כריית שליליים קשים. חשוב לשים לב שבחלק מהמאגרים הטקסט עצמו לא מופץ ישירות עקב מגבלות, אלא מסופקים רק מזהי השאילתות והמסמכים.

מתאים ל

  • אימון מודלי שיקוע לחיפוש

    כיול מודלי אמבדינג למערכות אחזור בעזרת דוגמאות חיוביות ושליליים קשים.

  • הערכת ביצועי מודלי שפה

    בדיקת איכות אחזור וסיווג בבנצ'מרקים מגוונים לפני הטמעה במערכות RAG.

  • אימון מסווגי טקסט

    שימוש בנתוני הסיווג הסינתטיים לשיפור הכללה במשימות תיוג ומיון טקסט.

איפה זה נופל

חלק גדול מהמאגרים אינו כולל את הטקסט המלא אלא רק מזהים, מה שמחייב תהליך הורדה ועיבוד מקדים ומסבך את תחילת העבודה. מבחינת שפות, למרות שהמאגר מוגדר רב לשוני וכולל את MIRACL, רוב המקורות מבוססים על אנגלית ואין פירוט ישיר לגבי נפח העברית שנכלל בו. בנוסף, המאגר כולל נתונים סינתטיים שנוצרו על ידי מודלי Llama שונים, מה שמכניס הטיות סגנוניות של מודלי שפה ויכול להגביל שימוש במוצרים סופיים לפי תנאי הרישיון שלהם.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מסחרי?

לא באופן גורף. המאגר הכולל מוגדר למחקר ופיתוח בלבד, וכל תת מאגר מגיע עם רישיון נפרד. בנוסף, הנתונים הסינתטיים כפופים לרישיונות של Llama 3.3 ו־Llama 4, ומאגרים כמו MIRACL דורשים רישיון שיתוף זהה.

האם יש במאגר טקסטים בעברית?

המאגר מוגדר רב לשוני בעיקר בזכות שילוב MIRACL, אך רוב המקורות הם באנגלית. כרטיס המאגר לא מפרט חלוקה מדויקת לשפות או התייחסות ספציפית לעברית, ולכן צריך לבדוק את התוכן ידנית לפני אימון ייעודי לשפה.

למה חלק מהטקסטים חסרים בקבצים?

במאגרים ציבוריים מסוימים אנבידיה מפיצה רק את מזהי השאילתות והמסמכים ולא את הטקסט המלא, כדי לעמוד במגבלות הפצה. כדי להשתמש בהם במלואם, עליכם להריץ סקריפט פייתון ייעודי שמושך את הטקסטים מהמקורות המקוריים.

איך טוענים

המאגר שוקל 2.3 גיגה בייט ומחולק לקובצי Parquet לפי תיקיות של כל תת מאגר, בלי צורך בבקשת גישה מיוחדת. במאגרים שבהם הטקסטים לא משותפים ישירות, תצטרכו להריץ סקריפט פייתון ייעודי של NeMo Automodel שמושך את הטקסט המקורי לפי המזהים. המבנה מבוסס על שדות question, question_id, pos_doc ו־neg_doc בשאילתות, ומזהה לצד טקסט אופציונלי בקובצי המסמכים.

from datasets import load_dataset

ds = load_dataset("nvidia/embed-nemotron-dataset-v1")

הרישיון

המאגר ברמת העל לא מדווח על רישיון אחיד, והוא מוגדר למחקר ופיתוח בלבד. כל תת מאגר כפוף לתנאים המקוריים שלו, כאשר FEVER ו־MIRACL ברישיון CC BY-SA 4.0, והדאטה הסינתטי ברישיון CC BY 4.0. הנתונים הסינתטיים יוצרו באמצעות Llama 3.3 ו־Llama 4, ולכן אימון מודל עליהם כפוף ישירות להסכמי הרישיון של מטא.

הרישיון המלא ב־Hugging Face ↗