GPT
N

nemotron-3.5-asr-streaming-0.6b

קוד פתוח

nvidiaother2026-05-15

  • nemo
  • safetensors
  • gguf
  • nemotron3_5_asr
  • feature-extraction

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

תמלול דיבור רציף בזמן אמת בנפח של 600 מיליון פרמטרים. אנבידיה בנו אותו כדי להחזיק מאות שיחות במקביל על חומרה אחת בלי לחשב שוב ושוב את אותן שניות שמע.

  • 638Mפרמטרים
  • 5.3 GBמשקל הקבצים
  • 949,719הורדות בחודש
  • 1,095לייקים

מה זה

הארכיטקטורה כאן מבוססת FastConformer ורכיב RNNT שזוכר את המצב של השכבות הקודמות. בהזרמת שמע רגילה שולחים חלונות חופפים והמעבד מחשב מחדש את העבר. כאן הוא מעבד רק את המקטע החדש, בין 80 ל־1120 מילישניות, ושולף את השאר מהזיכרון. התוצאה היא צריכת משאבים נמוכה משמעותית מזו של מודלים ישנים יותר כמו פאראקיט בנפח 1.1 מיליארד פרמטרים, עם פי 17 יותר הזנות בו־זמניות על כרטיס H100 בודד בחלון של 80 מילישניות.

הוא מזהה שפה בעצמו או מקבל קוד שפה כקלט, ופולט טקסט כולל אותיות גדולות ופיסוק מלא. התמיכה נחלקת לשפות מלוטשות, שפות מוכנות לייצור, ושפות שדורשות כוונון נוסף.

מתאים ל

  • סוכני קול בזמן אמת

    זמני תגובה של עשרות מילישניות מאפשרים לנהל שיחה קולית שוטפת באנגלית או ערבית בלי הפסקות מביכות.

  • שרתי תמלול מרובי שיחות

    ארכיטקטורת הזיכרון החסכונית מאפשרת להחזיק מאות שיחות במקביל על שרת בודד ולחתוך עלויות ענן.

  • זיהוי שפה וניתוב

    המודל פולט תגית שפה בסוף המשפט, מה שעוזר לנתב שיחות מעורבות בלי רכיב זיהוי שפה נפרד.

איפה זה נופל

העברית לא עובדת מהקופסה. היא מוגדרת ברמת הטוקנייזר בלבד כשפה להסתגלות, מה שאומר שהמודל יחזיר זבל מוחלט אם לא תאמנו אותו מראש על מאגר הקלטות ותמלולים מקומיים. בנוסף, אף שהחלון של 80 מילישניות נותן שיהוי אפסי, רמת הדיוק יורדת בהשוואה לחלונות של מעל שנייה, כך שחייבים לבחון את הפשרה מול הצרכים שלכם בשטח.

שאלות
נפוצות

האם הוא מתאים לתמלול שיחות בעברית?

לא בלי אימון עצמי. עברית שייכת לקבוצה השלישית בכרטיס המודל, מה שאומר שהטוקנייזר מכיר את האותיות אבל המודל לא אומן לתמלל אותה ישירות. תצטרכו לאסוף שעות שמע מתומללות ולבצע כוונון עדין בעצמכם כדי לקבל משהו שמיש.

מה עדיף, להשתמש בו באנגלית או במודל הייעודי לאנגלית?

אנבידיה עצמם מציינים שאם המוצר שלכם עובד באנגלית בלבד, עדיף להוריד את גרסת ה־English הבלעדית של נמוטרון. הגרסה הרב־לשונית הזו מיועדת ספציפית למקרים שבהם צריכים לתמוך בכמה שפות מאותו מודל או לזהות שפה באופן אוטומטי.

איך מריצים

אפשר להריץ אותו מקומית דרך NeMo-Speech.cpp עם קובץ GGUF מכווץ של 8 ביט, שזה מעולה אם רוצים לבדוק ביצועים על לפטופ בלי להסתבך עם ספריות כבדות. בשרת פיתוח אפשר להעלות אותו ישירות בספריית transformers החל מגרסה 5.13.0 או דרך NeMo המקורית של אנבידיה.

בגודל של 5.3 גיגהבייט ו־638 מיליון פרמטרים, כל כרטיס מסך מודרני עם 8 עד 12 גיגהבייט זיכרון יחזיק אותו בלי בעיה. אם הצורך הוא רק תמלול קבצים בדיעבד ללא הזרמה חיה, לפעמים פשוט וזול יותר לפנות ל־API קיים במקום להחזיק תשתית דולקת.

ollama run hf.co/nvidia/nemotron-3.5-asr-streaming-0.6b:Q8_0

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל שוחרר תחת רישיון שנקרא OpenMDW גרסה 1.1, ובתיעוד נכתב במפורש שהוא מוכן לשימוש מסחרי. עם זאת, ברישום הרשמי הרישיון מסומן כ־other. מומלץ לקרוא את נוסח הרישיון באתר היעודי שלו ולוודא שאין בו הגבלות על אופי המוצר לפני שמשלבים אותו בסביבה מסחרית רחבה.

הרישיון המלא בעמוד המודל ↗