GPT
C

canary-qwen-2.5b

קוד פתוח

nvidiacc-by-4.02025-06-26

  • nemo
  • safetensors
  • automatic-speech-recognition
  • speech
  • audio

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

שילוב בין מודל שמע למודל שפה של 2.6 מיליארד פרמטרים שמתמלל קול באנגלית בדיוק גבוה, ומאפשר להמשיך ישירות לעיבוד הטקסט, סיכום ומענה לשאלות על בסיס התוצאה.

  • 2.6Bפרמטרים
  • 4.8 GBמשקל הקבצים
  • 24,537הורדות בחודש
  • 460לייקים

מה זה

החיבור כאן מבוסס על FastConformer כשכבת קידוד שמע ועל שפת המודל Qwen3-1.7B כפענוח. המערך הזה עובד בשני מצבים נפרדים. במצב תמלול הוא ממיר אודיו באנגלית לטקסט עם פיסוק ואותיות גדולות, ובמצב טקסטואלי הוא מתנהג כמו מודל שפה רגיל שיכול לסכם את מה שנאמר או לענות על שאלות מתוך התמליל, אבל בלי גישה לאודיו הגולמי עצמו.

במבחני התמלול של OpenASR הוא מציג שגיאת מילים ממוצעת של 5.63 אחוז ומהירות הרצה של 418 RTFx. זה אומר שבשמע אידיאלי כמו Librispeech Clean הוא כמעט ולא מפספס עם 1.6 אחוז שגיאה, אבל בשיחות חופשיות מרובות דוברים כמו במאגר AMI שיעור השגיאות קופץ ל־10.18 אחוז.

מתאים ל

  • תמלול שיחות קצרות

    מתאים לקטעי דיבור של עד 40 שניות באנגלית, עם פיסוק מובנה ודיוק טוב של 5.63 אחוז שגיאה ממוצעת.

  • תמלול וסיכום משולב

    מבצע תמלול שמע ולאחר מכן עובר למצב טקסט כדי לתמצת את הנאמר ללא מודל חיצוני נפרד.

  • עיבוד אצווה מהיר בשמע

    רץ בקצב של 418 RTFx על כרטיסי אנבידיה, מה שמאפשר תמלול כמויות קבצים גדולות בזמן קצר מאוד.

איפה זה נופל

השמע מוגבל בקלט לעד 40 שניות בלבד, ואורך הרצף הכולל מוגבל ל־1024 טוקנים הכוללים הנחיה, שמע ותשובה. מעבר לכך הדיוק מתדרדר באופן משמעותי, כך שאי אפשר פשוט לזרוק אליו פודקאסט של שעה ברצף. בנוסף, הוא אומן על אנגלית בלבד. המקודד מכיר מעט גרמנית, צרפתית וספרדית, אך הוא אינו מיועד לשפות אלו ואינו מתאים כלל לעברית. תחת רעש לבן כבד עם יחס אות לרעש של 5- שיעור שגיאות המילים מזנק ל־30.6 אחוז, ומבחני שיחה הראו קפיצה לכ־16 אחוזי שגיאה.

שאלות
נפוצות

האם המודל יודע לתמלל הקלטות בעברית?

לא. המודל אומן על 234.5 אלף שעות באנגלית בלבד. מקודד הבסיס נחשף מעט לספרדית, צרפתית וגרמנית אך אינו מיועד לכך, ועברית אינה נתמכת כלל.

איך אפשר לתמלל קובץ אודיו של חצי שעה?

אי אפשר להעביר קובץ ארוך ישירות, מכיוון שהאימון בוצע על מקטעים של עד 40 שניות בלבד. תיאלצו לחתוך את ההקלטה מראש למקטעים קצרים, להריץ אותם בנפרד ולאחד את הפלטים.

האם המודל מסוגל לענות על שאלות מתוך הטון והאינטונציה של הדובר?

לא. במצב מודל שפה הוא אינו מנתח את האודיו הגולמי אלא מקבל רק את התמליל הטקסטואלי שהופק, ולכן אין לו גישה למאפיינים קוליים כמו נימת דיבור.

איך מריצים

המודל שוקל 4.8 ג'יגה־בייט בפורמט bfloat16 ודורש התקנה ישירה של NeMo מהמאגר בגיטהאב יחד עם PyTorch 2.6 ומעלה. בשביל להריץ אותו צריך כרטיס מסך של אנבידיה בארכיטקטורת Pascal ועד Blackwell, כאשר בדיקות החומרה של המפתחים נעשו על A6000, A100 ו־RTX 5090. כרטיס עם 8 עד 12 ג'יגה זיכרון יספיק להסקה של קבצים בודדים.

אם אתם צריכים תמלול שוטף של שמע רציף באצווה גדולה, עדיף להריץ מקומית עם מניפסט jsonl וליהנות מהמהירות הגבוהה. אם אין לכם כרטיס אנבידיה ייעודי בסביבת הפיתוח או שאתם נרתעים מהתלות בספריית NeMo המורכבת, עדיף לפנות ל־API חיצוני שמנגיש מודלים דומים.

pip install -U huggingface_hub
hf download nvidia/canary-qwen-2.5b

הקבצים

6 קבצים במאגר, 4.8 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא CC-BY-4.0. אפשר להשתמש בו לצרכים מסחריים, לשנות אותו, להטמיע אותו במוצרים ולהפיץ אותו בחופשיות. התנאי היחיד והמחייב הוא מתן קרדיט ברור למפרסמים המקוריים וציון שינויים שביצעתם.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗