GPT
N

Nemotron-3-Nano-Omni-30B-A3B-Reasoning-BF16

קוד פתוח

nvidiaother2026-04-20

  • transformers
  • safetensors
  • NemotronH_Nano_Omni_Reasoning_V3
  • feature-extraction
  • nvidia

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

מודל מולטימודלי של אנבידיה שקולט אודיו, וידאו, תמונות וטקסט, עם ארכיטקטורת תערובת מומחים שמפעילה רק שלושה מיליארד פרמטרים בפועל ומגיעה עם מצב חשיבה מובנה.

  • 33Bפרמטרים
  • 61.5 GBמשקל הקבצים
  • 335,369הורדות בחודש
  • 422לייקים

מה זה

המודל משלב שכבת בסיס מסוג Mamba2 וטרנספורמר בשיטת MoE, שמחזיקה 31 מיליארד פרמטרים בסך הכול אבל מפעילה בערך שלושה מיליארד פרמטרים בלבד בכל טוקן. יחד איתה פועלים מקודד התמונות והווידאו CRADIO v4-H ומקודד הקול Parakeet. השילוב הזה מאפשר לו לעבד במקביל וידאו עד שתי דקות, קובצי אודיו עד שעה, תמונות וטקסט, ולהחזיר תשובות טקסטואליות עם חלון הקשר של עד 256 אלף טוקנים.

הוא שונה מרוב המודלים בגודל הזה בזכות מנגנון הסקת המסקנות שפועל כברירת מחדל ופולט שרשרת חשיבה לפני התשובה הסופית. אפשר לכבות את החשיבה לקבלת מענה מהיר, לחתוך חצי מטוקני הווידאו כדי לקצר זמני עיבוד, ולקבל תמלול עם חותמות זמן ברמת המילה.

מתאים ל

  • ניתוח הקלטות פגישות באנגלית

    קולט קובצי קול של עד שעה ומספק תמלול מלא עם חותמות זמן ברמת המילה וסיכום נקודות.

  • חילוץ מידע ממסמכים וטבלאות

    מבצע קריאת OCR ומנתח תרשימים ודוחות פיננסיים על פני הקשר רחב של עד 256 אלף טוקנים.

  • אוטומציית סוכנים וממשקים

    מזהה אלמנטים בצילומי מסך של ממשקי תוכנה ותומך בקריאות לכלים בפורמט JSON לפעולות אוטומטיות.

איפה זה נופל

המודל תומך באנגלית בלבד. אם תזינו לו טקסט או דיבור בעברית, הוא לא בנוי להתמודד איתם. בנוסף, הוא פולט טקסט בלבד ולא מחזיר אודיו או וידאו. הווידאו מוגבל לשתי דקות בלבד, והקלט לא תומך בקובצי PDF ישירות, כך שחובה להמיר כל עמוד לתמונה לפני השליחה.

אותה משפחה

Nemotron-3-Nano-Omni-30B-A3B-Reasoning יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל מבין דיבור או טקסט בעברית?

לא. המפרט מגדיר תמיכה באנגלית בלבד עבור קלט ופלט. לשימוש בעברית תצטרכו להשתמש במודלים אחרים או לתרגם את המידע לפני ההזנה.

האם אפשר להריץ את גרסת ה־BF16 על מחשב אישי חזק?

לא. גרסת ה־BF16 דורשת לפחות כרטיס שרת של 80 גיגה-בייט זיכרון כמו H100. אם יש לכם מחשב עם כרטיס RTX 5090 בעל 32 גיגה-בייט, תצטרכו להוריד את גרסת ה־NVFP4.

האם ניתן לשלוח אליו קובץ PDF שלם ישירות לניתוח?

לא ישירות. המודל אינו מקבל קובצי PDF גולמיים, אלא תמונות. תצטרכו להשתמש בסקריפט חיצוני שממיר כל עמוד בקובץ לתמונה ומעביר אותה בבקשה.

איך מריצים

גרסת ה־BF16 שוקלת 61.5 גיגה-בייט ודורשת לפחות מאיץ H100 יחיד של 80 גיגה-בייט, כשבפועל מומלץ כרטיס H200 או B200. אם אין לכם גישה לשרת כזה, קיימות גרסאות מכווצות: FP8 שדורשת כרטיס L40S של 48 גיגה-בייט, או NVFP4 שמסוגלת לרוץ על כרטיס שולחני כמו RTX 5090 עם 32 גיגה-בייט וגם על פלטפורמות DGX Spark ו־Jetson Thor.

אפשר להרים אותו מקומית עם vLLM בגרסה 0.20 ומעלה, SGLang, TensorRT-LLM או Ollama. אם אתם צריכים את מלוא הדיוק ב־BF16 ואין לכם שרת ייעודי בענן עם מאיצים כבדים, עדיף להשתמש ב־API של Build.nvidia.com במקום לשלם על שרת עצמאי יקר.

from transformers import pipeline

pipe = pipeline("any-to-any", model="nvidia/Nemotron-3-Nano-Omni-30B-A3B-Reasoning-BF16")
print(pipe("שלום"))

הרישיון

השימוש כפוף להסכם NVIDIA Open Model Agreement, שמתיר שימוש מסחרי במודל ובנגזרות שלו, אבל מחייב עמידה בתנאי השימוש וההגבלות הספציפיים שמופיעים בהסכם של אנבידיה.

הרישיון המלא בעמוד המודל ↗