GPT
N

Nemotron-3-Nano-Omni-30B-A3B-Reasoning-FP8

קוד פתוח

nvidiaother2026-04-24

  • transformers
  • safetensors
  • NemotronH_Nano_Omni_Reasoning_V3
  • feature-extraction
  • nvidia

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

מודל מולטימודלי של 31 מיליארד פרמטרים שמפעיל רק 3 מיליארד בכל טוקן, ומנתח וידאו, אודיו, תמונה וטקסט עם חשיבה מובנית.

  • 33Bפרמטרים
  • 32.8 GBמשקל הקבצים
  • 858,404הורדות בחודש
  • 62לייקים

מה זה

מדובר במודל שמשלב ארכיטקטורת Mamba2 עם Transformer במבנה של תערובת מומחים. השילוב הזה שומר על נפח פעיל של כ־3 מיליארד פרמטרים בכל רגע, מה שמאפשר מהירות ריצה גבוהה בהרבה ממודלים בגודל מלא של שלושים מיליארד. הוא מאחד מקודד וידאו ותמונה מסוג CRADIO v4-H יחד עם מקודד שמע מסוג Parakeet, ומחזיר טקסט בלבד.

המודל מתוכנן לטפל בו זמנית בקובצי וידאו של עד שתי דקות, רצועות קול של עד שעה, מסמכים ותמונות, עם חלון הקשר של 256 אלף טוקנים. מצב החשיבה מופעל בו כברירת מחדל, כך שהוא מייצר שרשרת הסקה לפני התשובה הסופית, תומך בקריאות לכלים, פלט בפורמט JSON ותמלול עם חותמות זמן ברמת המילה.

מתאים ל

  • תמלול וניתוח שיחות

    קולט קובצי שמע של עד שעה, מתמלל עם חותמות זמן ומחלץ תובנות באנגלית.

  • פענוח מסמכים וטבלאות

    מנתח צילומי עמודים, חוזים וגרפים ארוכים בתוך חלון הקשר של 256k טוקנים.

  • אוטומציית סוכנים וממשק

    מבין צילומי מסך, תומך בהפעלת כלים ומחזיר JSON ישירות למערכות ניהול.

איפה זה נופל

המגבלה המרכזית היא שפה: המודל תומך באנגלית בלבד. אם תזרקו עליו עברית, במסמכים או בהקלטות קול, אין כאן תמיכה רשמית והתוצאות לא צפויות. בווידאו הוא מוגבל לשתי דקות בלבד ודורש דגימה נמוכה של פריים או שניים לשנייה, כך שהוא לא מתאים למעקב אחר רצפי תנועה מהירים. בנוסף, המערכת אינה מקבלת קובצי PDF ישירות, וחובה להמיר כל עמוד לתמונה בקוד לפני השליחה.

אותה משפחה

Nemotron-3-Nano-Omni-30B-A3B-Reasoning יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ את גרסת ה־FP8 על מחשב מקומי עם כרטיס ביתי?

לא. משקל הקבצים הוא כמעט 33 גיגהבייט ודרישת המינימום היא כרטיס שרת עם 48 גיגהבייט זיכרון כמו L40S. אם יש לכם כרטיס חזק כמו RTX 5090 עם 32 גיגהבייט, תצטרכו להשתמש בגרסת ה־NVFP4.

האם המודל יודע לקרוא מסמכים ותפריטים בעברית?

לא. כרטיס המודל מציין תמיכה באנגלית בלבד. כל שימוש בתמונות, מסמכים או שמע בעברית אינו נתמך רשמית ולא מתאים למערכות ייצור.

איך מבטלים את פלט תהליך החשיבה כדי לקבל רק תשובה?

שולחים בקריאה את הפרמטר enable_thinking עם הערך false. ברירת המחדל מפעילה את מנגנון החשיבה ומייצרת הסבר מפורט לפני המענה הסופי.

איך מריצים

גרסת ה־FP8 שוקלת כ־33 גיגהבייט ודורשת לפחות כרטיס L40S של 48 גיגהבייט כדי לעלות, כשנווידיה ממליצה על RTX Pro 6000 או B200. אם יש לכם כרטיס שולחני כמו RTX 5090 עם 32 גיגהבייט תצטרכו לרדת לגרסת NVFP4 ששוקלת 21 גיגהבייט, ואילו גרסת ה־BF16 המלאה שוקלת 62 גיגהבייט ודורשת לפחות H100 בודד של 80 גיגהבייט.

אפשר להרים אותו מקומית בתוך קונטיינר של vLLM מגרסה 0.20.0, או דרך SGLang ו־TensorRT-LLM בלינוקס. למי שאין כרטיס דאטה סנטר מודרני, שווה להשתמש בנקודת הקצה ב־build.nvidia.com במקום להסתבך עם חלוקת זיכרון מקומית.

from transformers import pipeline

pipe = pipeline("any-to-any", model="nvidia/Nemotron-3-Nano-Omni-30B-A3B-Reasoning-FP8")
print(pipe("שלום"))

הרישיון

השימוש כפוף ל־NVIDIA Open Model Agreement. הרישיון מתיר שימוש מסחרי, אך הוא אינו רישיון קוד פתוח סטנדרטי כמו Apache או MIT, ולכן חובה לקרוא את תנאי ההסכם של נווידיה לגבי הפצה מחדש והטמעה במוצרים לפני שיוצאים לדרך.

הרישיון המלא בעמוד המודל ↗