GPT
C

canary-180m-flash

קוד פתוח

nvidiacc-by-4.02025-03-11

  • nemo
  • automatic-speech-recognition
  • automatic-speech-translation
  • speech
  • audio

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

מודל תמלול ותרגום דיבור קל משקל שרץ במהירות קיצונית על כרטיסי מסך. הוא מיועד למי שצריך לפענח שעות של אודיו בארבע שפות אירופיות בלי לשלם על שרתים כבדים.

  • 703 MBמשקל הקבצים
  • 2,811הורדות בחודש
  • 112לייקים

מה זה

מדובר במודל זיהוי דיבור ותרגום של אנבידיה עם 182 מיליון פרמטרים, ששוקל כ־703 מגה־בייט בלבד. הוא בנוי בארכיטקטורת FastConformer מקודד ומפענח טרנספורמר, ותומך בתמלול בארבע שפות: אנגלית, גרמנית, צרפתית וספרדית, לצד תרגום ישיר בין אנגלית לשלוש האחרות. הוא מפיק טקסט עם או בלי סימני פיסוק ואותיות גדולות, וכולל פיצ'ר ניסיוני לחותמות זמן ברמת המילה והמקטע.

היתרון המרכזי כאן הוא מהירות הפענוח. במבחני OpenASR הוא מציג קצב של מעל 1200 RTFx על A100 ומעל 2000 RTFx על H100, מה שאומר שהוא מעבד שעה של אודיו בפחות משלוש שניות. ברמת הדיוק, המודל מגיע ל־1.87% שגיאות מילים בטקסט אנגלי נקי, אך בסביבות מאתגרות כמו שיחות פתוחות ב־AMI שיעור השגיאות קופץ ל־14.86%, כך שהגודל הקומפקטי גובה מחיר בהקלטות מורכבות.

מתאים ל

  • תמלול ארכיונים באנגלית

    המהירות הגבוהה מאפשרת לעבד כמויות עצומות של הקלטות נקיות בעלות מחשוב נמוכה מאוד.

  • תרגום שיחות מוקלטות

    הוא מתרגם ישירות מאודיו בגרמנית, צרפתית או ספרדית לטקסט באנגלית בלי מודל תרגום נפרד.

  • הרצה על חומרת קצה

    משקל קובץ של 703 מגה ותמיכה ב־Jetson מאפשרים לשלב זיהוי דיבור במכשירים מקומיים בלי חיבור רשת.

איפה זה נופל

החיסרון המובהק הוא היעדר מוחלט של תמיכה בעברית, המודל מוגבל לאנגלית, גרמנית, ספרדית וצרפתית בלבד. בנוסף, הוא רגיש מאוד לרעש רקע, כאשר ברמת יחס אות לרעש של מינוס חמישה דציבלים שיעור שגיאות המילים מזנק ל־34.03%. הפלט אינו מטפל בתווים מיוחדים, עלול לדרוש נרמול טקסט נוסף, ותכונת חותמות הזמן מוגדרת כניסיונית בלבד.

שאלות
נפוצות

האם המודל מתאים לתמלול שיחות בעברית?

לא. המודל אומן ותומך בארבע שפות בלבד: אנגלית, גרמנית, ספרדית וצרפתית. הוא לא יזהה דיבור בעברית.

האם אפשר להזין לו קובץ פודקאסט של שעה ברצף?

לא ישירות בפקודת תמלול רגילה, כי המודל תוכנן לקטעים של עד 40 שניות. כדי לתמלל שעה שלמה יש להשתמש בסקריפט החיתוך שמגיע עם NeMo, שמפרק את הקובץ לחלקים ומאחה את הטקסט.

מה המשמעות של קצב פענוח מעל 1200 RTFx?

זה אומר שעל כרטיס A100 המודל מסוגל לעבד שעה של אודיו תוך פחות משלוש שניות עבודה של המעבד הגרפי. זה הופך אותו לפתרון חסכוני במיוחד כשמדובר בעיבוד אצוות גדולות.

איך מריצים

המודל דורש התקנה של ספריית NeMo מבית אנבידיה ורץ ישירות בפייתון. הוא מקבל קובצי wav או flac בערוץ בודד וקצב דגימה של 16000 הרץ, בלי צורך בעיבוד מוקדם. ארכיטקטורת החומרה הנתמכת רחבה מאוד וכוללת כרטיסים החל מדור Pascal ועד Lovelace, Hopper, Blackwell וכרטיסי Jetson למחשוב קצה, על גבי לינוקס או ווינדוס.

המודל מתוכנן לקטעי שמע קצרים מ־40 שניות. כדי לתמלל קבצים ארוכים יותר צריך להשתמש בסקריפט חיתוך ואיחוד ייעודי שמסופק בספרייה, או לחתוך את האודיו לחלקים של 10 שניות אם רוצים חותמות זמן מדויקות.

pip install -U huggingface_hub
hf download nvidia/canary-180m-flash

הקבצים

3 קבצים במאגר, 703 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא CC-BY-4.0, רישיון חופשי ומתירני שמאפשר שימוש מסחרי, שינוי והפצה של המודל. התנאי היחיד הוא מתן קרדיט מתאים לאנבידיה על פי תנאי הרישיון, ללא מגבלות נוספות על שילובו במוצרים סגורים.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗