GPT
N

Nemotron-Labs-Audex-30B-A3B

קוד פתוח

nvidiaother2026-07-06

  • transformers
  • safetensors
  • nemotron_labs_audex
  • nvidia
  • nemotron-labs-audex

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

מודל MoE שמחבר אודיו וטקסט ומפעיל רק שלושה מיליארד פרמטרים בכל שלב. הוא מאפשר האזנה, תמלול, יצירת סאונד ודיבור לצד יכולות חשיבה ארוכות של מיליון טוקנים.

  • 66.8 GBמשקל הקבצים
  • 621הורדות בחודש
  • 176לייקים

מה זה

הארכיטקטורה מבוססת על שלד טקסט של שלושים מיליארד פרמטרים בתצורת תערובת מומחים, שמתוכם רק שלושה מיליארד פעילים בכל רגע נתון. המודל מרחיב את אוצר המילים הרגיל כך שיכיל ייצוגים בדידים של אודיו, וכולל מקודד מובנה לקליטת קול ומפענחים ייעודיים לפליטת סאונד. השילוב הזה מטפל בהבנת שמע, תמלול דיבור, תרגום, יצירת אפקטים קוליים, דיבור מטקסט ושיחה מקצה לקצה בלי לפגוע ביכולות ההיגיון והחשיבה של שלד הטקסט המקורי.

הוא תומך בחלון הקשר עצום של עד מיליון טוקנים ופועל בשני מצבי עבודה שונים, מצב חשיבה עם שרשרת מחשבה מפורטת ומצב הוראות ישיר. כדי להפיק ממנו סאונד או דיבור משלבים אותו עם מקודדים חיצוניים כמו XCodec1 או מפענח הדיבור הסיבתי של החברה, מה שהופך אותו למנוע רב תכליתי שחוסך תלייה במספר מודלים נפרדים לכל פעולת שמע.

מתאים ל

  • עוזר שיחה קולי דו כיווני

    מאפשר קליטת דיבור, תהליך חשיבה פנימי והחזרת תשובה קולית ברצף אחד, בלי לשרשר מודלים שונים.

  • תמלול ותרגום הקלטות ארוכות

    תמיכה בחלון הקשר של עד מיליון טוקנים מאפשרת לעבד קובצי שמע כבדים ולבצע עליהם ניתוח מעמיק.

  • יצירת אפקטים קוליים מטקסט

    הפקת צלילים ואודיו לפי תיאור טקסטואלי מפורט באמצעות שילוב מפענחי קול ייעודיים.

איפה זה נופל

המודל מגיע עם שרשרת הרכבה מסובכת שמחייבת התעסקות בקבצים חיצוניים, קידודים שונים לכל משימה ודריסה ידנית של תבניות פרומפט לפי סוג המטלה. תבנית ברירת המחדל שלו מתנגשת לפעמים בין מצב שמע למצב טקסט, ובשביל לקבל ביצועי טקסט נקיים צריך להמיר את המשקלים או להגביל טוקנים של אודיו באופן יזום. בנוסף, המפרט הרשמי מציין תמיכה בשפה האנגלית בלבד, כך שאי אפשר להסתמך עליו בעיבוד או הבנה של שפות אחרות בלי בדיקה זהירה מראש.

אותה משפחה

Nemotron-Labs-Audex יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להשתמש במודל לפיתוח אפליקציה מסחרית?

לא. הרישיון שצורף למודל הוא רישיון לא מסחרי מפורש של NVIDIA, ולכן הוא מוגבל לשימושי מחקר, בדיקות ובחינה טכנולוגית בלבד.

כמה זיכרון וידאו צריך כדי להריץ את המודל?

המשקלים תופסים קרוב לשבעים ג'יגה בייט וקוד ההרצה הרשמי מוגדר לחלוקה בין שמונה מעבדים גרפיים, כך שדרוש שרת ענן חזק עם כמה כרטיסים מקצועיים כדי להעלות אותו.

איך עוברים בין מצב חשיבה למצב תשובה ישירה?

השליטה מתבצעת ברמת התחילית של הפרומפט, כאשר שימוש בתגית פתיחה של מחשבה מפעיל את שרשרת ההיגיון, ותגית סגירה מובילה לתשובה ישירה ללא שלב ביניים.

איך מריצים

המשקל הכולל של הקבצים מגיע לשישים ושבעה ג'יגה בייט, כך שתצטרכו שרת עם כמה מעבדים גרפיים חזקים כדי להתמודד איתו. סקריפטי ההרצה הרשמיים בודקים את המודל בהרצה מבוזרת עם שמונה כרטיסים גרפיים במקביל דרך vLLM 0.20.0, ודפי המודל מציינים גם דרישות לחבילות ספציפיות כמו mamba-ssm וקודני שמע נלווים.

מי שרוצה להריץ אותו דרך ספריית transformers הרגילה יצטרך גרסאות עדכניות וסביבה שתומכת בקרנלים מקומיים של CUDA. בשל מורכבות התלויות החיצוניות בקידודי קול שונים והמשאבים הכבדים הנדרשים לפריסה מקומית, פתרון שרת ייעודי או סביבת ענן מוגדרת מראש עדיפים בהרבה על ניסיון להרים אותו במחשב פיתוח רגיל.

from transformers import pipeline

pipe = pipeline("text-generation", model="nvidia/Nemotron-Labs-Audex-30B-A3B")
print(pipe("שלום"))

הקבצים

119 קבצים במאגר, 66.8 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

השימוש במודל כפוף לרישיון בלעדי לא מסחרי של NVIDIA. המשמעות ברורה ופשוטה, מותר להשתמש בו לצורכי מחקר, ניסויים פנימיים ופיתוח אקדמי בלבד. מי שמתכנן להטמיע אותו במוצר שמייצר הכנסה או בשירות לקוחות פעיל לא יכול לעשות זאת באופן חוקי תחת הרישיון הנוכחי.

הרישיון המלא בעמוד המודל ↗