GPT
C

canary-1b

קוד פתוח

nvidiacc-by-nc-4.02024-02-07

  • nemo
  • automatic-speech-recognition
  • automatic-speech-translation
  • speech
  • audio

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

מודל תמלול ותרגום קולי שמתמקד בארבע שפות אירופיות ומציג דיוק מרשים ביחס למשקל של מיליארד פרמטרים בלבד. אם אתם עובדים עם אנגלית, גרמנית, ספרדית או צרפתית, הוא מועמד חזק לבדיקה.

  • 3.8 GBמשקל הקבצים
  • 2,219הורדות בחודש
  • 459לייקים

מה זה

מדובר במודל שמבצע תמלול אוטומטי ותרגום ישיר מדיבור לטקסט בארבע שפות בלבד: אנגלית, גרמנית, ספרדית וצרפתית. המבנה שלו משלב מקודד מסוג FastConformer עם מפענח Transformer, שניהם בעומק של 24 שכבות, ובסך הכול מיליארד פרמטרים. בנוסף להמרת הקול, הוא מאפשר לשלוט מראש בהוספת פיסוק ואותיות גדולות באמצעות טוקנים ייעודיים בהזנת הנתונים.

במבחני דיוק על מאגרי MCV 16.1 ו־MLS, המודל מציג שגיאות מילים בודדות, סביב 3% עד 8% תלוי בשפה ובמאגר. תרגום הדיבור מאנגלית לשפות האחרות ומהן חזרה לאנגלית מגיע לתוצאות BLEU שנעות בין 21 ל־40 בבנצ'מרקים המקובלים. הוא אומן על שמונים וחמישה אלף שעות דיבור, שרובן המוחלט באנגלית ומיעוטן בשלוש השפות האחרות.

מתאים ל

  • תמלול שיחות באנגלית

    זיהוי דיבור מדויק באנגלית עם שליטה בהוספת סימני פיסוק ואותיות גדולות ישירות בפלט.

  • תרגום פודקאסט מאירופה

    המרת דיבור ישירה מגרמנית, צרפתית או ספרדית לקובצי טקסט באנגלית ללא שלב תמלול ביניים.

  • פרויקט מחקר בלשני

    בדיקת ביצועי FastConformer על מאגרי מידע רב-לשוניים תחת רישיון פתוח למחקר.

איפה זה נופל

הבעיה המרכזית היא היעדר מוחלט של תמיכה בעברית. המודל מוגבל לחלוטין לאנגלית, גרמנית, ספרדית וצרפתית, ולא יזהה שום שפה אחרת. בנוסף, יש פער עצום בנתוני האימון, מעל עשרים וחמישה אלף שעות באנגלית לעומת פחות משלושת אלפים שעות בכל אחת מהשפות האחרות. בבדיקות ההוגנות שהוצגו בכרטיס, שיעור השגיאות בקטגוריית מגדר שאינה זכר או נקבה זינק ל־126.92%, נתון שמראה כשל נקודתי חמור במקרים מסוימים.

אותה משפחה

canary יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בתמלול או תרגום לעברית?

לא. המודל אומן אך ורק על אנגלית, גרמנית, ספרדית וצרפתית. הוא אינו מזהה קובצי קול בעברית ולא יודע לתרגם אליה או ממנה.

האם אפשר להשתמש בו במוצר מסחרי?

לא ישירות מהקובץ הזה. הרישיון שבו הוא מופץ אוסר כל שימוש מסחרי, ולכן להפצה במוצר נדרשת פנייה לאנבידיה או שימוש בגרסאות ייעודיות דרך Riva.

איזה קלט שמע צריך לספק לו כדי שיעבוד תקין?

המודל מקבל קובצי אודיו בערוץ יחיד בלבד, כלומר מונו, שנדגמו בתדר של 16000 הרץ. יש להעביר את הנתונים דרך קובץ מניפסט או כנתיב לקובץ שמע נתמך.

איך מריצים

כדי להריץ אותו צריך להתקין את ספריית NeMo של אנבידיה יחד עם PyTorch ו־Cython. המודל מופץ כקובץ במשקל 3.8 גיגהבייט, כך שהוא דורש כרטיס מסך עם לפחות שמונה גיגהבייט זיכרון כדי לבצע היקש בצורה יציבה, במיוחד אם מגדילים את גודל האצווה מעבר לברירת המחדל.

הקלט חייב להיות קובץ שמע מונו בקצב דגימה של 16000 הרץ, מוגדר ישירות בנתיב לקובץ או דרך קובץ מניפסט בפורמט jsonl שבו מציינים שפת מקור ויעד. אנבידיה מציעה גם נקודת קצה מנוהלת דרך Riva ו־NIM, שעדיפה למי שלא רוצה לתחזק תשתית כרטיסי מסך עצמאית.

pip install -U huggingface_hub
hf download nvidia/canary-1b

הקבצים

4 קבצים במאגר, 3.8 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא CC-BY-NC-4.0. המשמעות פשוטה: המודל מיועד אך ורק למחקר, בדיקות ושימוש אישי שאינו מסחרי. אסור לשלב אותו במוצר שמייצר הכנסות, למכור שירותים שמבוססים עליו, או להטמיע אותו במערכות פנימיות של חברה מסחרית בלי לרכוש רישוי מתאים ישירות מאנבידיה.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗