GPT
C

canary-1b-flash

קוד פתוח

nvidiacc-by-4.02025-03-07

  • nemo
  • safetensors
  • fastconformer
  • automatic-speech-recognition
  • automatic-speech-translation

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

תמלול ותרגום קולי בארבע שפות אירופיות במהירות גבוהה במיוחד. המודל מתאים למי שמעבד כמויות אודיו עצומות וצריך קצב הסקה של מעל אלף פי זמן אמת על חומרה מתאימה.

  • 811Mפרמטרים
  • 6.3 GBמשקל הקבצים
  • 4,484הורדות בחודש
  • 279לייקים

מה זה

מדובר במודל מבוסס FastConformer עם 883 מיליון פרמטרים, שמיועד לתמלול ותרגום בין אנגלית, גרמנית, ספרדית וצרפתית. הוא אומן על 85 אלף שעות דיבור וכולל 32 שכבות מקודד וארבע שכבות מפענח בלבד, מה שמאפשר לו לקצץ את צוואר הבקבוק החישובי הרגיל של מפענחי טקסט. המבנה הזה נותן לו להפיק תמלול מדויק עם ניקוד ואותיות רישיות, יחד עם חותמות זמן ברמת המילה והמקטע.

היתרון המרכזי כאן הוא התפוקה. במדידות על כרטיסי שרת הוא חוצה קצב של פי 1000 מזמן אמת, בלי לשלם מחיר כבד בדיוק ביחס למודלים מקבילים. באנגלית נקייה הוא עומד על 1.48 אחוזי שגיאת מילים, ובהקלטות שיחה יומיומיות מורכבות יותר מגיע לכ־13 אחוזים. גם בצרפתית, גרמנית וספרדית שיעורי השגיאה נשארים נמוכים מאוד, באזור שניים עד ארבעה אחוזים במבחני מאגרי דיבור סטנדרטיים.

מתאים ל

  • תמלול ארכיונים באנגלית

    קצב של פי אלף מאפשר לסרוק עשרות אלפי שעות שמע באנגלית, גרמנית או צרפתית בזמן קצר מאוד.

  • יצירת כתוביות לסרטונים

    שילוב של סימני פיסוק, אותיות רישיות וחותמות זמן ברמת המילה מתאים ישירות לייצור כתוביות.

  • תרגום שיחות מוקלטות

    תרגום ישיר משמע בצרפתית, גרמנית או ספרדית לטקסט אנגלי מבלי להריץ שני מודלים נפרדים בדרך.

איפה זה נופל

החיסרון הבולט לקורא הישראלי הוא היעדר מוחלט של עברית. המודל תומך בארבע שפות בלבד, כך שהוא לא יעזור למוצרים שמכוונים לשוק המקומי בלי אימון מחדש. בנוסף, חלון הקלט הטבעי מוגבל לעד ארבעים שניות. אם מנסים לתמלל קטעים ארוכים יותר ישירות ללא פיצול, הביצועים נפגעים. מנגנון חותמות הזמן מוגדר רשמית כניסיוני, ורעשי רקע חזקים מפילים את הדיוק שלו בצורה חדה, משיעור שגיאה של כשני אחוזים באות נקי לכמעט שלושים אחוזים ברעש גבוה.

שאלות
נפוצות

האם המודל מבין או מתמלל שמע בעברית?

לא. המודל אומן ותומך בארבע שפות בלבד: אנגלית, גרמנית, ספרדית וצרפתית. כל ניסיון לתת לו שמע בעברית יפיק ג'יבריש או שגיאות תמלול.

מה צריך לעשות כדי לתמלל הקלטה שנמשכת שעה?

אי אפשר להעביר קובץ של שעה ישירות למודל כי הוא תומך באודיו של עד ארבעים שניות. צריך להשתמש בסקריפט החלוקה למקטעים של ספריית NeMo, שחותך את הקובץ, מריץ את התמלול ומחבר בחזרה את הטקסט.

האם אפשר להריץ אותו דרך ספריית Transformers רגילה?

לא בצורה ישירה ופשוטה. המודל תלוי בספריית NeMo ובארכיטקטורת FastConformer של אנבידיה, כך שחייבים את סביבת העבודה שלהם כדי לטעון ולהריץ אותו.

איך מריצים

בשביל להריץ אותו חייבים להתקין את ספריית NeMo של אנבידיה. המודל שוקל 6.3 גיגה בייט בקובצי המשקולות, כך שבפועל צריך כרטיס גרפי עם לפחות שמונה עד שנים עשר גיגה בייט זיכרון כדי לבצע איתו תמלול יעיל במנות.

קובץ הקלט צריך להיות שמע מונו בקצב דגימה של 16 קילוהרץ בפורמט וואב או פלאק. אם יש לכם הקלטות ארוכות מארבעים שניות, צריך לחתוך אותן במקטעים באמצעות סקריפט ייעודי שמספקת החברה, ולכן עיבוד של פודקאסטים או שיחות טלפון מלאות דורש שכבת פייפליין נוספת לפני שמגיעים למודל עצמו.

pip install -U huggingface_hub
hf download nvidia/canary-1b-flash

הקבצים

7 קבצים במאגר, 6.3 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הקוד והמשקולות מופצים ברישיון CC-BY-4.0. הרישיון הזה מתיר שימוש מסחרי מלא, כולל שינוי, שילוב במערכות ייצור והפצה מחדש, בלי לשלם תמלוגים. הדרישה החוקית היחידה היא מתן קרדיט ברור לאנבידיה על המודל המקורי, והוספת קישור לתנאי הרישיון וציון אם נעשו שינויים בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗