GPT
N

Nemotron-3-Nano-Omni-30B-A3B-Reasoning-NVFP4

קוד פתוח

nvidiaother2026-04-24

  • transformers
  • safetensors
  • NemotronH_Nano_Omni_Reasoning_V3
  • feature-extraction
  • nvidia

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

מודל מולטימודלי של 31 מיליארד פרמטרים שמפעיל רק 3 מיליארד בכל שלב. הוא מקבל וידאו, שמע, תמונה וטקסט, ומגיע מראש בכיול NVFP4 שרץ על כרטיס בודד של 32 גיגהבייט.

  • 18Bפרמטרים
  • 20.9 GBמשקל הקבצים
  • 745,615הורדות בחודש
  • 188לייקים

מה זה

הארכיטקטורה כאן מחברת בין Mamba2, שכבות Transformer ומבנה של תערובת מומחים. מתוך 31 מיליארד פרמטרים, כל טוקן מפעיל כ־3 מיליארד בלבד, מה ששומר על מהירות חישוב גבוהה. הוא נשען על המקודד CRADIO v4-H לעיבוד תמונות ופריימים של וידאו, ועל Parakeet לקליטת שמע. בניגוד למודלים שמסתפקים בתמונות וטקסט, הוא מעכל קובצי וידאו שלמים וקובצי שמע של עד שעה, ופולט טקסט, קריאות לכלים או מבנה JSON.

המודל כולל מנגנון חשיבה מובנה שפועל כברירת מחדל, עם שרשרת מחשבה לפני התשובה הסופית. אם רוצים תגובה מהירה יותר, מכבים את המצב הזה בהגדרות הקריאה. הוא גם יודע להוציא תמלול שמע עם חותמות זמן ברמת המילה, ולעבד מסמכים גרפיים וממשקי משתמש דרך הקלט החזותי.

מתאים ל

  • תמלול שמע עם חותמות זמן

    מקבל קובצי אודיו של עד שעה ומתמלל אותם באנגלית יחד עם חותמת זמן מדויקת לכל מילה.

  • ניתוח סרטוני הדרכה קצרים

    מעבד קובצי וידאו של עד שתי דקות לצורך הפקת סיכומים ותשובות על המתרחש בתמונה ובקול.

  • אוטומציה של ממשקי משתמש

    מזהה אלמנטים גרפיים בצילומי מסך ומפעיל קריאות לכלים ולסוכנים מבוססי דפדפן.

איפה זה נופל

הקלט מוגבל מאוד באורכו, עד שתי דקות וידאו בלבד, בקצבים של פריים אחד או שניים לשנייה. קובצי PDF אינם נתמכים ישירות, ותצטרכו לרנדר כל עמוד לתמונה בעצמכם לפני השליחה. מעבר לכך, המודל תומך רשמית באנגלית בלבד. אם תזינו לו טקסט או שמע בעברית, אתם מחוץ למפרט הרשמי ואין שום ערובה לדיוק. מצב החשיבה גם זולל טוקנים רבים אם לא מגבילים אותו ידנית בתקציב ייעודי.

שאלות
נפוצות

האם אפשר להריץ את גרסת ה־NVFP4 על כרטיסי מסך מדורות קודמים כמו RTX 3090 או 4090?

הפורמט NVFP4 מותאם ומיועד לארכיטקטורות החדשות של אנבידיה כמו סדרת Blackwell. בדורות ישנים יותר תתקלו בבעיות תמיכה או שתצטרכו לעבור לגרסאות ה־BF16 וה־FP8, שדורשות נפח זיכרון גדול משמעותית.

האם המודל יודע לחלץ טקסט ישירות מקובצי PDF?

לא. המודל אינו מקבל קובצי PDF ישירות בקלט. עליכם להמיר כל עמוד בקובץ לתמונה נפרדת ולשלוח אותה למודל לעיבוד OCR.

איך מריצים

כדי להריץ את גרסת ה־NVFP4 הזו צריך כרטיס מסך תומך עם 32 גיגהבייט זיכרון לפחות, כמו RTX 5090, או חומרה כמו Jetson Thor ו־DGX Spark. אם אתם רוצים את גרסת ה־BF16 המלאה תצטרכו כרטיס של 80 גיגהבייט כמו H100, ובגרסת FP8 תידרשו לכרטיס של 48 גיגהבייט כמו L40S. ההרצה המקומית מתבצעת בעיקר דרך vLLM 0.20.0 או מנוע TensorRT-LLM בלינוקס.

אם אין לכם כרטיסי מסך מהדורות האחרונים של אנבידיה עם תמיכה ב־NVFP4, אין טעם לנסות להריץ את המשקלים האלה מקומית. במקרה כזה עדיף לקרוא למודל דרך ה־API של אנבידיה ב־build.nvidia.com במקום להחזיק שרת יקר ייעודי.

from transformers import pipeline

pipe = pipeline("any-to-any", model="nvidia/Nemotron-3-Nano-Omni-30B-A3B-Reasoning-NVFP4")
print(pipe("שלום"))

הרישיון

השימוש כפוף לרישיון NVIDIA Open Model Agreement. הרישיון מאפשר שימוש מסחרי במודל, אך הוא אינו רישיון קוד פתוח סטנדרטי ודורש עמידה בתנאי ההסכם של אנבידיה בעת שילובו במוצרים.

הרישיון המלא בעמוד המודל ↗