GPT
N

NVIDIA-Nemotron-3-Nano-Omni-30B-A3B-Reasoning-GGUF

קוד פתוח

unslothother2026-04-27

  • gguf
  • nvidia
  • unsloth
  • nemotron-3
  • multimodal

מודל מולטימודלי מלא של 31 מיליארד פרמטרים שמנתח טקסט, תמונה, וידאו ואודיו תחת קורת גג אחת. מתאים למי שחייב לעבד הקלטות ומסמכים מורכבים מקומית עם מנגנון חשיבה מובנה.

  • 475 GBמשקל הקבצים
  • 16,002הורדות בחודש
  • 143לייקים

מה זה

המודל משלב ארכיטקטורת מומחים מסוג Mamba2 וטרנספורמר, עם מקודד ראייה CRADIO ומקודד קול Parakeet. מתוך 31 מיליארד הפרמטרים שלו רק כארבעה מיליארד פעילים בכל צעד, מה שמאפשר לו להגיב מהר יחסית לגודלו. הוא מקבל קובצי וידאו של עד שתי דקות, אודיו של עד שעה, תמונות וטקסט, ויודע להוציא תמלול עם זמנים ברמת המילה ומבני נתונים בפורמט ג'ייסון.

הייחוד כאן הוא יכולת החשיבה בשרשרת שמשולבת ישירות במשימות מולטימודליות. הוא אומן בין היתר על בסיס מודלים ממשפחת Qwen ודגמי קוד פתוח גדולים, ומציע חלון הקשר של עד 256 אלף טוקנים. זה מאפשר לו להתמודד עם שאלות מורכבות על פגישות מוקלטות או מסמכים ארוכים בלי לאבד את התמונה הכוללת.

מתאים ל

  • ניתוח ישיבות והדרכות וידאו

    מאפשר תמלול מדויק לפי מילים יחד עם מענה לשאלות וחילוץ נקודות עיקריות מהקלטה.

  • חילוץ נתונים מטפסים וחשבוניות

    קורא מסמכים סרוקים כתמונות וממיר את הפרטים למבנה ג'ייסון מדויק בעזרת מנגנון חשיבה.

  • אוטומציה של ממשקי משתמש

    מזהה אלמנטים על גבי מסכים וסרטוני הדרכה לצורך הפעלת סוכני בינה מלאכותית בדפדפן.

איפה זה נופל

המודל תומך באופן רשמי באנגלית בלבד. אם תזינו לו עברית, במסמכים או בהקלטות קוליות, הוא לא מיועד לזה ואין ערובה לתוצאות תקינות. בנוסף, הוא מוגבל לווידאו של שתי דקות בלבד, אינו קורא קובצי פידיאף ישירות אלא דורש המרה ידנית שלהם לתמונות, ודורש כוונון רגיש של תקציב החשיבה כדי לא לרוקן את הזיכרון בהקשרים ארוכים.

שאלות
נפוצות

האם המודל מבין הקלטות או מסמכים בעברית?

הכרטיס מציין תמיכה באנגלית בלבד. כל שימוש בעברית עשוי להוביל להזיות בתמלול ופענוח שגוי של תמונות.

איך מטפלים בקובצי מסמכים כמו פידיאף?

הוא לא מקבל קובצי פידיאף ישירות. חובה להמיר מראש כל עמוד לתמונת פיאנג'י או ג'ייפג ולהעביר אותה כמחרוזת בייס שישים וארבע.

איך מריצים

כדי להריץ אותו צריך כרטיס גרפי חזק של אנבידיה עם זיכרון משמעותי, כמו A100 עם שמונים גיגה או חומרת בלקוול, ותמיכה בקוברנטיס או דוקר תחת לינוקס. מנועי ההרצה הנתמכים כוללים את vLLM בגרסה 0.20 ומעלה, SGLang וכן TensorRT-LLM, ויש צורך בהתקנת ספריות קול נפרדות כמו ליברוסה כדי לטפל בקבצי אודיו.

אם אין לכם שרת ייעודי כזה בחברה, עדיף לפנות לנקודת הקצה הרשמית של אנבידיה דרך ענן במקום לקנות חומרה יקרה. הרצה עצמית שווה את המאמץ בעיקר כשאתם מחויבים לפרטיות מוחלטת של קובצי המדיה או בונים אוטומציה פנימית של ממשקי משתמש.

ollama run hf.co/unsloth/NVIDIA-Nemotron-3-Nano-Omni-30B-A3B-Reasoning-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

27 קבצים במאגר, 475 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון מבוסס על הסכם המודלים הפתוחים של אנבידיה ומאפשר שימוש מסחרי. יש לעיין בתנאי ההסכם הרשמיים כדי לוודא עמידה בהגבלות ההפצה, אך אין מניעה עקרונית לשלב אותו במוצרים פעילים.

הרישיון המלא בעמוד המודל ↗