GPT
L

Llama-Nemotron-VLM-Dataset-v1

קוד פתוח

nvidiacc-by-4.02025-08-05

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

אוסף של כמעט שלושה מיליון דוגמאות אימון למודלי ראייה ושפה. הדאטה מיועד להבנת מסמכים, טבלאות ופענוח טקסט מתמונות, עם תיוגים שנוצרו במיוחד ברישיונות מתירניים.

  • 4,297הורדות בחודש
  • 168לייקים

מה זה

המאגר כולל 21 תתי מאגרים שמחולקים לשלוש קטגוריות עיקריות: שאלות ותשובות ויזואליות, תיאורי תמונות ומשימות זיהוי תווים. הרשומות מגיעות בשילוב היברידי של נתונים סינתטיים לחלוטין שרונדרו מתווים אקראיים, עיבודים של טקסטים מוויקיפדיה, ותיוג מחדש של מאגרים ציבוריים מוכרים כמו OpenImages, TextVQA, DocLayNet וגרפים ממאגר ChartQA.

אנבידיה סיננה את החומר באמצעות אשכולות K-means כדי להבטיח גיוון והגבילה את כמות הדגימות מכל מקור. תהליך הניקוי כלל הסרת תיוגים שגויים, שאלות שלא תואמות לתמונה, טקסטים שחוזרים על עצמם ודיוק מספרי מופרז שלא תואם את המידע החזותי. עבור חלק ניכר מהדוגמאות נוצרו הסברי שרשרת מחשבה, הרחבות לתשובות קצרות ופרומפטים סינתטיים שנבנו עם מודלים כמו VILA-1.5-40B, Qwen2-VL-72B ו־InternVL2-Llama3-76B.

מתאים ל

  • חילוץ מידע מטבלאות ומסמכים

    אימון מערכות לניתוח מבנה של דוחות פיננסיים וטבלאות סרוקות באמצעות דגימות ייעודיות.

  • הבנת תרשימים וגרפים

    פיתוח סוכני בינה מלאכותית שמסוגלים להשיב על שאלות מורכבות מתוך גרפים ואיורים מדעיים.

  • זיהוי תווים בתנאים קשים

    שיפור ביצועי פענוח טקסט בצילומי מסך ודפים עמוסים באנגלית ובסינית על בסיס דאטה סינתטי.

איפה זה נופל

החומר מתמקד אך ורק באנגלית ובסינית, כך שאין כאן שום מידע בעברית או תמיכה ביישור מימין לשמאל. יש תלות כבדה בנתונים סינתטיים שרונדרו ממחשב או שנוצרו על ידי מודלי שפה, מה שעלול לייצר הזיות עקביות בניתוח מסמכים אמיתיים. בנוסף, העובדה שחלק מהתמונות אינן כלולות במאגר אלא דורשות הורדה נפרדת מאתרים חיצוניים מסבכת את שחזור הנתונים המלא.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מודל מסחרי?

כן, אך יש לשים לב לחלוקת הרישיונות הפנימית. בעוד שרוב האוסף מוגדר תחת cc-by-4.0, ארבעה קבצים כפופים לרישיון שיתוף זהה cc-by-sa 4.0, וחלק מהדגימות הסינתטיות כוללות הגבלות מרישיונות המקור של Qwen ו־Llama 3.

כמה שטח אחסון צריך כדי להוריד את כל הדאטה?

הנפח הכולל עומד על 747.86 גיגה בייט המפוזרים על פני 155 קבצים. חלק מהחבילות מכילות רק קובצי jsonl ומחייבות הורדה נפרדת של התמונות מהמקורות המקוריים שלהן ברשת.

האם המאגר כולל נתונים בעברית?

לא. הנתונים מתמקדים מפורשות באנגלית ובסינית בלבד, הן בחלקים הסינתטיים של זיהוי התווים והן בשאלות והתשובות. מי שמחפש לאמן מודל מסמכים לעברית יצטרך לאסוף נתונים ממקור אחר.

איך נאספו התמונות והתשובות במאגר?

האיסוף נעשה בשיטה היברידית המשלבת דגימות שרונדרו באופן סינתטי לחלוטין עם תמונות ממאגרים חופשיים כמו OpenImages ו־TextVQA. התיוגים והתשובות נוצרו ועובדו מחדש באמצעות שרשראות מודלים כדוגמת VILA-1.5-40B וכללים מובנים.

איך טוענים

טעינת הנתונים נתמכת דרך כלי בשם Megatron Energon לצד סקריפט הדגמה בשם example_loader.py שיושב במאגר. הקבצים מחולקים לתיוגים בפורמט jsonl עם קובצי אינדקס תואמים, כאשר חלק מהמאגרים כוללים את התמונות עצמן בארכיוני tar מחולקים וחלקם דורשים הורדה עצמאית של התמונות ממקורות חיצוניים. הנפח הכולל מגיע ל־747.86 גיגה בייט ומכיל 2,863,854 דגימות, לכן נדרש אחסון מקומי רחב ותמיכה בהורדת קבצים כבדים דרך git lfs.

from datasets import load_dataset

ds = load_dataset("nvidia/Llama-Nemotron-VLM-Dataset-v1")

הרישיון

המאגר הראשי מופץ ברישיון cc-by-4.0 שמתיר שימוש מסחרי ושינויים בכפוף למתן קרדיט. יחד עם זאת, ארבעה תתי מאגרים מוגדרים תחת cc-by-sa 4.0 המחייב שיתוף זהה, ושילובם עלול להדביק את הנגזרות ברישיון זה. דוגמאות שנוצרו על ידי מודלים מסוימים כפופות לתנאי הרישיון של Qwen או של Meta Llama 3, מה שדורש בדיקה פרטנית לפני אימון מודל מסחרי סגור.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗