GPT
N

Nemotron-Labs-Audex-2B

קוד פתוח

nvidiaother2026-07-06

  • transformers
  • safetensors
  • nemotron_labs_audex
  • nvidia
  • nemotron-labs-audex

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

מודל קומפקטי שמחבר שמע וטקסט ומבצע תמלול, דיבור ויצירת סאונד באותה רשת. הוא מתאים למי שחייב מולטימודליות של אודיו מקומית בלי לבלוע משאבי שרת מוגזמים.

  • 11.4 GBמשקל הקבצים
  • 1,329הורדות בחודש
  • 87לייקים

מה זה

במקום לחבר כמה מערכות נפרדות לתמלול, חשיבה והקראה, המודל הזה מרכז הכל תחת ארכיטקטורה אחת צפופה בגודל של כשני מיליארד פרמטרים. הוא מבין אודיו, מתמלל, מתרגם, מייצר אפקטים קוליים ומקריא טקסט, תוך שמירה על יכולות טקסט של מודל שפה רגיל עם חלון הקשר שמגיע עד 128 אלף טוקנים.

הוא מציע שני מצבי עבודה, מצב חשיבה שבו הוא מפרט את תהליך הפתרון בתוך תגיות ייעודיות, ומצב הנחיות רגיל שפולט תשובה מיד. להבדיל מגרסת השלושים מיליארד באותה משפחה שעברה גם שלב חיזוק מתקדם, הגרסה הזו שוחררה אחרי אימון התאמה רב שלבי בלבד.

מתאים ל

  • עוזר קולי מקומי מאוחד

    מאפשר שיחה משולבת אודיו וטקסט ברשת יחידה בלי להקים צינור עיבוד נפרד.

  • תמלול ותרגום אנגלית

    רץ ביעילות על כרטיס מסך בודד ומספק תמלול ישיר של קובצי קול באנגלית.

  • מחקר על מודלי קול מובנים

    מתאים לבדיקת יכולות חשיבה בתוך שמע על מודל פתוח שאינו דורש חוות שרתים.

איפה זה נופל

ההפעלה שלו רחוקה מלהיות נקייה. תבניות הפרומפט דורשות מניפולציות ידניות של תגיות חשיבה כדי לא לקלקל את הפלט, וההפרדה בין שמע לטקסט מחייבת התקנת תוספים ייעודיים או חיתוך טוקנים ידני כדי שמילים לא יתערבבו עם צלילים. בנוסף, המודל אומן ונבדק באנגלית בלבד, כך שאינו מתאים לעבודה בעברית ללא אימון נוסף. החיסרון המשמעותי מול הגרסה הגדולה הוא היעדר שלב הלמידה מחיזוקים, מה שמורגש באיכות התוצאה במשימות מורכבות.

אותה משפחה

Nemotron-Labs-Audex יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה עבור תמלול או שיחה בעברית?

התיעוד מגדיר את המודל לשפה האנגלית בלבד. הוא לא אומן על עברית, ולכן לא יתאים למשימות זיהוי דיבור או הפקת קול בשפה זו.

למה צריך להוריד ספריות נוספות כמו XCodec אם המודל כבר כולל אודיו?

המודל מייצר ומקבל טוקנים בדידים של אודיו, אך אינו ממיר אותם בעצמו לגל קול ישיר. כדי להפיק קובצי שמע להאזנה או לקודד קבצים קיימים, חייבים לשלב קודק ייעודי בשרשרת הריצה.

איך מריצים

כדי להריץ אותו תצטרכו כרטיס מסך בודד עם לפחות 16 עד 24 גיגה זיכרון גרפי, בהתחשב בכך שמשקל הקבצים לבדו תופס 11.4 גיגה. nvidia מספקת תמיכה דרך vLLM או ספריית transformers, אבל היא דורשת תוסף ייעודי של החברה לצד קודקים חיצוניים כמו XCodec כדי לחלץ את האודיו בפועל.

אם כל מה שאתם צריכים זה רק תמלול או הקראת טקסט בסיסית, חבל על ההתעסקות בהרצה עצמית. ההתקנה של שרשרת הקידוד המלאה מסורבלת, ובמקרים כאלה עדיף לפנות לפתרון API ייעודי במקום לתחזק את כל המעטפת.

from transformers import pipeline

pipe = pipeline("text-generation", model="nvidia/Nemotron-Labs-Audex-2B")
print(pipe("שלום"))

הקבצים

106 קבצים במאגר, 11.4 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

השימוש כפוף לרישיון NVIDIA OneWay Noncommercial. הרישיון אוסר שימוש מסחרי מכל סוג ומיועד למחקר ולניסויים בלבד. אם אתם בונים מוצר שמיועד ללקוחות משלמים או לשירות עסקי פעיל, אסור להשתמש במודל הזה.

הרישיון המלא בעמוד המודל ↗