GPT
P

nvidia/parakeet-tdt-0.6b-v2

קוד פתוח

nvidiacc-by-4.02025-04-15

  • nemo
  • automatic-speech-recognition
  • speech
  • audio
  • Transducer

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

תמלול אנגלית מהיר בצורה חריגה, שמוציא אותיות גדולות, פיסוק וזמנים ברמת המילה. הוא מתאים למי שצריך לעבד כמויות של אודיו באנגלית בלי לשלם על מודל ענק.

  • 2.3 GBמשקל הקבצים
  • 266,084הורדות בחודש
  • 1,542לייקים

מה זה

המודל מתבסס על ארכיטקטורת FastConformer עם מפענח TDT וכולל 600 מיליון פרמטרים. הוא מקבל קובצי אודיו בפורמט WAV או FLAC בערוץ בודד ובדגימה של 16kHz, ומסוגל לתמלל קטעים רצופים באורך של עד 24 דקות במעבר יחיד. האימון שלו נשען על מאגר Granary בהיקף של כ־120,000 שעות אנגלית, שרובן המכריע מתוייגות אוטומטית.

המטרה העיקרית במבנה הזה היא מהירות עיבוד גבוהה. בבדיקות של אנבידיה עם batch size של 128 הוא מציג יחס זמן אמת (RTFx) של 3380. מבחינת דיוק, ממוצע ה־WER שלו עומד על 6.05% על פני מערכי הבדיקה של HF-Open-ASR. באודיו נקי הוא יורד ל־1.69% ב־LibriSpeech, אבל בשיחות ועידה ובפגישות מרובות משתתפים כמו AMI ו־Earnings-22 הטעות קופצת לאזור ה־11%.

מתאים ל

  • תמלול הקלטות פודקאסטים

    יכולת עיבוד של 24 דקות במעבר אחד לצד פלט שכולל אותיות גדולות וסימני פיסוק חוסכת עבודת עריכה.

  • הפקת כתוביות לסרטונים

    הוא מייצר חותמות זמן מדויקות ברמת המילה והתו, מה שמאפשר לסנכרן טקסט לאודיו ללא שלב יישור נפרד.

  • תמלול שיחות טלפון באנגלית

    הביצועים בקידוד μ-law של 8kHz נשארים יציבים יחסית עם פגיעה קטנה של כ־4% בדיוק בהשוואה לאודיו מלא.

איפה זה נופל

המודל מיועד אך ורק לאנגלית, כך שלעברית או שפות מעורבות הוא לא רלוונטי בכלל. הירידה באיכות מורגשת מאוד כשיש רעשי רקע: ביחס אות לרעש של 0dB שיעור השגיאות כמעט מוכפל ומגיע ל־11.88%, וב־SNR שלילי הוא מתפרק לחלוטין מעבר ל־20% שגיאה.

בנוסף, הכרטיס מצהיר מפורשות שהמודל תלוי מאוד בהקשר, אינו מתאים למשפטים מקוטעים או קריאה מילה-במילה, ויתקשה לתמלל מילים ומונחים שלא קיימים באוצר המילים שעליו התאמן.

אותה משפחה

parakeet-tdt יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר לתמלל איתו עברית?

לא. המודל אומן על אנגלית בלבד ולא יזהה דיבור בעברית. אם אתם צריכים שפות נוספות, אנבידיה שחררה גרסת V3 שמכסה שפות אירופיות, אך גם בה אין תמיכה בעברית.

איך המודל מתמודד עם שיחות באיכות שמע נמוכה?

על אודיו טלפוני טיפוסי של 8kHz הוא שומר על WER ממוצע של 6.32%, שזה כמעט זהה לביצועים באודיו איכותי. מנגד, אם האודיו מכיל רעשי סביבה חזקים ולא רק דחיסה טלפונית, שיעור השגיאות מזנק במהירות.

האם חייבים כרטיס מסך כדי להשתמש בו?

הקוד והמימושים של NeMo מותאמים לריצה על גבי מעבדים גרפיים של אנבידיה. הרצה על מעבד מרכזי בלבד אינה מעשית מבחינת ביצועים, ואם אין ברשותכם חומרה תואמת עדיף לעבוד מול ה־API של Riva.

איך מריצים

המודל שוקל 2.3 גיגהבייט ודורש לפחות 2 גיגהבייט זיכרון רק כדי להיטען, אך צריכת הזיכרון בפועל עולה ככל שמאכילים אותו בקבצים ארוכים יותר. הוא בנוי לעבוד על כרטיסי אנבידיה (תומך בארכיטקטורות Volta, Ampere, Hopper, Blackwell ודגמי T4/L4) תחת לינוקס, ומחייב התקנה של ספריית NeMo בגרסה 2.2 עם PyTorch.

למי שרוצה לבדוק היתכנות בלי להרים תשתית מקומית ולשבור את הראש על תלויות NeMo, אנבידיה מספקת נקודת קצה חינמית דרך build.nvidia.com שמתקשרת באמצעות פרוטוקול gRPC בספריית Riva. אם הצרכים שלכם הם קריאות מזדמנות או בדיקות ראשוניות, עדיף להשתמש ב־API הזה במקום להחזיק שרת ייעודי.

pip install -U huggingface_hub
hf download nvidia/parakeet-tdt-0.6b-v2

הקבצים

4 קבצים במאגר, 2.3 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

רישיון CC-BY-4.0 מתיר שימוש מסחרי ולא מסחרי, כולל שינוי של המודל והפצה שלו בתוך מוצרים. הדרישה היחידה היא מתן קרדיט מתאים לאנבידיה וציון אם בוצעו שינויים בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗