GPT
N

Nemotron-Image-Training-v3

קוד פתוח

nvidiacc-by-4.02026-04-16

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

אוסף של 76 תת מאגרים לאימון מודלי ראייה ושפה עם כמעט שבעה מיליון דוגמאות. מי שיוריד אותו מחפש בעיקר שיחות מובנות ומגוונות סביב תמונות, עם תיוגים סינתטיים מתקדמים.

  • 4,932הורדות בחודש
  • 81לייקים

מה זה

המאגר מרכז 76 תת מאגרים שונים ומכיל כ 6.9 מיליון רשומות שמסתכמות ב 39.56 מיליארד טוקנים. הרשומות בנויות כשיחות מרובות הודעות בפורמט JSONL, המיועדות למשימות שאלות ותשובות על תמונות, פענוח טקסט מתמונה והסקה לוגית חזותית.

המקורות מבוססים על דאטהסטים ציבוריים מוכרים כמו AOKVQA או CC3M, לצד קובצי PDF וסריקות בסינית. התיוגים לא נכתבו בידי אדם אלא חולצו ונוצרו באופן סינתטי על ידי מודלים דוגמת סדרת Qwen 3 ו Qwen 3.5, כאשר חלק מהנתונים עברו אימות נוסף באמצעות Gemini 3 Flash.

מתאים ל

  • אימון הוראות למודלי ראייה

    לימוד מודלים רב מודליים לענות על שאלות מורכבות סביב תמונות ותרשימים.

  • שיפור יכולות OCR והסקה

    אימון על מסמכים וקבצי PDF כדי לחלץ טקסט ולבצע עליו ניתוח לוגי ישיר.

  • בדיקת איכות נתונים סינתטיים

    הערכת היעילות של תוויות שנוצרו על ידי מודלים מתחרים באימון רשתות ראייה.

איפה זה נופל

התמונות אינן כלולות במאגר, כך שאם קישורים מקוריים נשברו ברשת, חלק מהדוגמאות יאבדו לחלוטין. התיוגים כולם סינתטיים ונוצרו על ידי מודלים אחרים, מה שמכניס הזיות וטעויות זיהוי מובנות שלא סוננו בידי אדם. בנוסף, חלקים גדולים מוקדשים לסינית ואנגלית, ואין כל עדות לקיומו של תוכן בעברית או התאמה למסמכים מישראל.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מודל מסחרי?

כן, המאגר מסומן תחת רישיון CC-BY-4.0 ומוגדר כמוכן לשימוש מסחרי. עם זאת, מכיוון שהפיקסלים עצמם מגיעים ממאגרי מקור חיצוניים, עליכם לוודא שגם תנאי השימוש של כל תת מאגר ספציפי מתירים שימוש מסחרי.

כמה שוקל הדאטהסט והאם ההורדה כוללת תמונות?

ההורדה מ Hugging Face כוללת רק קובצי טקסט ואינדקס בפורמט JSONL, כך שהנפח הישיר קטן יחסית. התמונות עצמן לא כלולות במאגר, ונדרשת הורדה נפרדת של מיליוני תמונות ממקורות שונים כדי להשתמש במידע.

האם יש במאגר תמיכה בעברית?

לא, התיעוד לא מציג תכנים בעברית. המאגר מתמקד בעיקר באנגלית ובשפה הסינית עבור משימות קריאת מסמכים ושאילת שאלות.

איך נוצרו התשובות והתיוגים בנתונים?

כל התיוגים הופקו באופן סינתטי באמצעות מודלים כמו Qwen 3 ו Qwen 3.5 על בסיס התמונות המקוריות. בחלק מתתי המאגרים נעשה תהליך אימות נוסף על ידי מודל Gemini 3 Flash.

איך טוענים

אין כאן קובץ תמונות ענק שאפשר פשוט להוריד ולהתחיל לרוץ. המאגר מספק 500 קבצים הכוללים טקסט בפורמט JSONL וקובצי אינדקס, בעוד שהמדיה עצמה מופיעה רק כהפניות ונתיבים. עליכם להוריד את התמונות בעצמכם ממקורות המקור לפי ההוראות בכל תיקייה, ולסדר אותן במבנה תיקיות תואם כדי שהנתיבים ייפתחו. הפורמט מותאם לטעינה עם Megatron Energon של אנבידיה ואינו דורש אישור גישה מיוחד.

from datasets import load_dataset

ds = load_dataset("nvidia/Nemotron-Image-Training-v3")

הרישיון

המאגר מופץ ברישיון CC-BY-4.0 שמתיר שימוש מסחרי, שינוי והפצה, בתנאי שניתן קרדיט מתאים. הרישיון חל על קובצי הטקסט והשיחות, אך מכיוון שהתמונות נמשכות ממקורות חיצוניים שונים, חובה לבדוק בנפרד את תנאי השימוש של כל מקור מדיה לפני שמאמנים עליו מודל מסחרי.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗