GPT
N

Nemotron-VLM-Dataset-v2

קוד פתוח

nvidiacc-by-4.02025-10-13

  • document-understanding
  • multilingual
  • vision-language-model

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

אוסף נתונים רחב לאימון מודלי ראייה-שפה עם כמעט תשעה מיליון דוגמאות. הוא מביא שרשראות חשיבה מובנות, הבנת וידאו וממשקי משתמש, שנועדו להקפיץ יכולות הסקת מסקנות במודלים פתוחים.

  • 10,300הורדות בחודש
  • 94לייקים

מה זה

המאגר מכיל קרוב לתשעה מיליון רשומות שמחולקות לעשרות תת-מאגרים שונים. תמצאו כאן שאלות ותשובות ויזואליות, ניתוח דיאגרמות ותרשימים, משימות הבנת ממשקי משתמש, וסרטוני וידאו קצרים ממקורות כמו ActivityNet לצד פעולות יומיומיות. חלק ניכר מהרשומות מתמקד בהסקה מרובת שלבים, שם צורפו עקבות חשיבה מפורטים כדי ללמד את המודל לפרק בעיות ויזואליות מורכבות.

המקורות מגוונים מאוד וכוללים מאגרי מידע ציבוריים, נתונים סינתטיים של טבלאות, וגזירות ויקיפדיה בעשר שפות שונות כמו אנגלית, גרמנית, ספרדית, יפנית וקוריאנית. התוויות נוצרו בשילוב של תיוג אוטומטי, כולל תיוג באמצעות מודלים כמו סדרת Qwen להפקת עקבות מחשבה, לצד חילוץ ישיר של נתוני אמת. בנובמבר 2025 בוצע ניקוי של תגיות חשיבה שבורות ותוקנו הוראות לחלק מקבצי הטבלאות הפיננסיות.

מתאים ל

  • אימון מודלי ראייה-שפה

    הוספת משימות וידאו ותמונות כדי ללמד מודלים לענות על שאלות חזותיות מורכבות.

  • פיתוח מנגנוני חשיבה

    שימוש בעקבות החשיבה המובנות לאימון מודלים על פתרון בעיות צעד אחר צעד.

  • ניתוח מסמכים וממשקים

    שיפור ביצועים של מודלים בהבנת טבלאות דלילות, דיאגרמות וממשקי משתמש גרפיים.

איפה זה נופל

המאגר סובל מפיזור בעייתי של המדיה בפועל, כאשר תת-מאגרים רבים כוללים רק מטא-דאטה ומחייבים הורדה ידנית ממקורות חיצוניים. התיוג האוטומטי שבוצע באמצעות מודלי שפה עלול לגרור הזיות בעקבות החשיבה, למרות הניקוי החלקי שנעשה בנובמבר 2025. חוסר מובהק נוסף נוגע לשפות שאינן כלולות בעשר שפות הוויקיפדיה, עברית למשל נעדרת לחלוטין מנתוני הטקסט המצורפים, מה שהופך אותו ללא רלוונטי לאימון ישיר על שפה מקומית.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, רוב המאגר מוגדר תחת רישיון CC-BY-4.0 המאפשר שימוש מסחרי מלא עם מתן קרדיט. יחד עם זאת, תת-המאגרים של ויקיפדיה כפופים לרישיון מחמיר של שיתוף זהה, ולכן כדאי להחריג אותם אם אינכם מתכוונים לפתוח את המודל הסופי.

האם המאגר כולל תמיכה בעברית?

לא, המאגר אינו כולל נתונים בעברית. השפות היחידות שנתמכות בוויקיפדיה ובחלקי ה־OCR כוללות אנגלית, שפות אירופאיות מרכזיות, ושפות אסייתיות כמו יפנית, קוריאנית וסינית.

איך נאספו ונוצרו הנתונים במאגר?

הנתונים נאספו משילוב של מאגרי תמונות ווידאו קיימים, טבלאות סינתטיות וערכי ויקיפדיה. התוויות ושרשראות החשיבה הופקו בחלקן באמצעות מודלי שפה חיצוניים כמו Qwen, לצד כלים ייעודיים של אנבידיה לייצור נתוני OCR.

האם כל התמונות והסרטונים נמצאים בתוך המאגר?

לא, רק חלק מקובצי המדיה ארוזים ישירות בתוך ההורדה. בחלקים נרחבים תמצאו רק את התיוגים, הטקסטים וההפניות, ותצטרכו להוריד את קובצי המקור עצמאית לפי ההנחיות המצורפות.

איך טוענים

הקבצים מאורגנים בפורמט JSONL עם קובצי אינדקס תואמים, ומיועדים לטעינה ישירה באמצעות Megatron Energon של אנבידיה. הגישה למאגר פתוחה ואינה דורשת אישור מיוחד, אך הנפח הכולל מגיע למאות ג'יגה-בייט ודורש תשתית אחסון רחבה. שימו לב שלא כל קובצי המדיה נכללים במאגר עצמו, בחלק מתת-המאגרים תקבלו רק את קובצי התיוג וההוראות, ותצטרכו להוריד את התמונות או הסרטונים המקוריים בעצמכם.

from datasets import load_dataset

ds = load_dataset("nvidia/Nemotron-VLM-Dataset-v2")

הרישיון

המאגר מופץ תחת רישיון CC-BY-4.0 המתיר שימוש מסחרי, מחקרי ושינוי הנתונים, בתנאי שניתן קרדיט מתאים ליוצרים. חריג חשוב חל על עשרת תת-המאגרים שנגזרו מוויקיפדיה, הכפופים לרישיון CC BY-SA 4.0 ומחייבים שיתוף תחת תנאים זהים, נקודה שחובה לבדוק מבחינה משפטית אם מאמנים מודל מסחרי סגור על נתונים אלה.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗