GPT
P

parakeet-ctc-1.1b

קוד פתוח

nvidiacc-by-4.02023-12-28

  • nemo
  • safetensors
  • gguf
  • parakeet_ctc
  • automatic-speech-recognition

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

תמלול קול לאנגלית בלבד שמכוון למהירות גבוהה על גבי חומרת אנבידיה. הוא מתאים למי שרוצה לפרוס מודל דיבור חזק ועצמאי בתוך תשתית מקומית.

  • 1.1Bפרמטרים
  • 9.0 GBמשקל הקבצים
  • 1,198,029הורדות בחודש
  • 58לייקים

מה זה

מדובר במודל זיהוי דיבור פרי שיתוף פעולה בין אנבידיה לבין סונו, שמבוסס על ארכיטקטורת FastConformer עם פענוח CTC. הוא מאומן על 64 אלף שעות שמע באנגלית, מתוכן 40 אלף שעות מפרויקט פרטי והיתר ממאגרים ציבוריים מוכרים כמו ליבריספיץ' ופיפלס ספיץ'. הרעיון המרכזי בארכיטקטורה הזו הוא דחיסה מוקדמת של השמע פי שמונה באמצעות קונבולוציות, מה שמקצר משמעותית את זמן העיבוד ביחס למודלים ישנים יותר.

מבחינת דיוק, המדידות מציגות שיעור שגיאות מילים של 1.83 בלבד במבחן הנקי של ליבריספיץ', אבל המספר הזה עולה ל־13.69 במאגר ארנינגס-22 ול־15.62 במאגר AMI. המשמעות בפועל ברורה: בהקלטות מבודדות וברורות הוא פוגע כמעט בכל מילה, אבל בשיחות מרובות משתתפים, ישיבות או פודקאסטים עם דיבור חופשי הוא יפספס באופן מורגש.

מתאים ל

  • תמלול הקלטות שמע באנגלית

    מתאים לשרתי עיבוד שמע באנגלית שמקבלים שיחות מוקלטות וצריכים המרה מהירה לטקסט.

  • הטמעה בתוכנות מקומיות

    הרצה על גבי C++ באמצעות קובץ GGUF, בלי תלות ברשת חיצונית או שירותי ענן יקרים.

  • אימון ייעודי על דאטה פנימי

    בסיס רחב שכבר למד 64 אלף שעות שמע, ומתאים לחידוד על מונחים מקצועיים באנגלית.

איפה זה נופל

המגבלה הראשונה שקופצת לעין מפתחים ישראלים היא שהמודל תומך באנגלית בלבד, ואין לו שום יכולת לפענח שמע בעברית. בנוסף, הפלט מגיע אך ורק באותיות קטנות ללא אותיות גדולות. הוא דורש קלט מדויק של ערוץ מונו בודד בתדר 16000 הרץ, כך שכל קובץ שמע אחר דורש המרה מקדימה לפני השליחה.

שאלות
נפוצות

האם אפשר לתמלל איתו שיחות היברידיות באנגלית ובעברית?

לא. המודל אומן על אנגלית בלבד ומכיל אוצר מילים מצומצם המבוסס על האלפבית האנגלי באותיות קטנות. כל דיבור בעברית פשוט יימחק או יתומלל כרצף תווים שגוי.

האם המודל מוציא סימני פיסוק ואותיות גדולות?

הפלט מגיע באותיות קטנות בלבד, כפי שמוגדר במאפייני המודל. כדי להציג את התמלול למשתמשי קצה בפורמט קריא תצטרכו להעביר את הטקסט דרך שלב נוסף של שחזור פיסוק.

איך מריצים

המודל שוקל תשעה גיגהבייט בקבצי המקור שלו, מה שאומר שבשביל להריץ אותו בזיכרון צריך כרטיס מסך עם לפחות 10 עד 12 גיגהבייט של וידאו ראם עבור הסקה נוחה, במיוחד כשמעבירים באצ'ים. הוא רץ ישירות דרך ספריית NeMo של אנבידיה או דרך ספריית הטרנספורמרס של האגינג פייס. יש גם אופציה קלה יותר שנקראת NeMo-Speech ב־C++, שמאפשרת להריץ קובץ מכווץ בפורמט GGUF אם רוצים להימנע מסביבת פייתון כבדה.

קריאה ל־API חיצוני עדיפה בעיקר אם אין לכם גישה שוטפת לכרטיס מסך ייעודי של אנבידיה בשרת, או כשהיקף התמלול קטן ומזדמן ולא מצדיק אחזקת שרת באוויר.

ollama run hf.co/nvidia/parakeet-ctc-1.1b:Q8_0

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא CC-BY-4.0. המשמעות פשוטה: מותר להשתמש במודל לצרכים מסחריים, לשנות אותו, להטמיע אותו במוצר שלכם או לאמן אותו מחדש, כל עוד אתם נותנים קרדיט מתאים ליוצרים.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗