GPT
D

distil-large-v3.5

קוד פתוח

distil-whispermit2024-12-05

  • transformers
  • tensorboard
  • safetensors
  • whisper
  • automatic-speech-recognition

גרסה מזוקקת של Whisper לתמלול באנגלית, שטסה פי 1.5 יותר מהר מגרסת הטורבו של OpenAI. היא מתאימה למי שרוצה דיוק כמעט זהה למקור בלי לשלם על זמני ריצה ארוכים.

  • 756Mפרמטרים
  • 2.8 GBמשקל הקבצים
  • 6,479הורדות בחודש
  • 94לייקים

מה זה

זהו מודל תמלול שמבוסס על Whisper-Large-v3, אבל עבר תהליך זיקוק ידע עם 98 אלף שעות אימון. המטרה שלו פשוטה, לחתוך את זמן העיבוד בחצי בלי לאבד את היכולת להבין הקלטות קשות. הוא יודע להוציא חותמות זמן ומסתדר עם הקלטות קצרות ושיחות ארוכות כאחד.

ההבדל מורגש מול גרסת הטורבו הרשמית. במבחני אודיו קצרים מחוץ למאגר האימון הוא השיג שגיאת מילים של 7.08 לעומת 7.30 של הטורבו, ובמהירות הוא עוקף אותו בעקביות ומגיע לפקטור זמן אמת של 49.34 לעומת 33.81. בהקלטות ארוכות הוא מפגר באחוז בודד ברמת הדיוק, פשרה סבירה מאוד בהתחשב בקפיצת המהירות.

מתאים ל

  • תמלול שיחות קצרות

    עוקף בדיוק את גרסת הטורבו בהקלטות תחת 30 שניות ומחזיר טקסט במינימום שיהוי.

  • מאיץ ל־Whisper מקורי

    משמש כמודל טיוטה בפיענוח ספקולטיבי ומכפיל את המהירות בלי לאבד אף מילה.

  • עיבוד אודיו מקומי

    רץ נקי דרך whisper.cpp על מחשבים פשוטים בלי לשלוח מידע לרשת.

איפה זה נופל

הוא מיועד לאנגלית בלבד. אם תזרקו עליו עברית, הוא פשוט לא יעבוד. בנוסף, בהקלטות ארוכות מאוד הוא עדיין פחות מדויק מגרסת הטורבו של OpenAI ומגיע ל־11.39 שגיאות מילים במבחנים חיצוניים לעומת 10.25. נקודה קריטית נוספת, אפשרויות קוונטיזציה של 4 ו־8 ביט עדיין מוגדרות בפיתוח ולא זמינות רשמית בכרטיס.

אותה משפחה

distil-large יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם הוא מבין עברית?

לא. המודל אומן ותוכנן אך ורק עבור השפה האנגלית. אם הדאטה שלכם כולל שפות מעורבות או עברית, תצטרכו להישאר עם הגרסאות הרב־לשוניות הרגילות של Whisper.

מה עדיף, המודל הזה או large-v3-turbo?

אם רוב האודיו שלכם קצר ומהירות התגובה היא המדד העיקרי, המודל הזה מהיר בערך פי 1.5 וגם מעט מדויק יותר. אם אתם מתמללים בעיקר הרצאות ארוכות וצריכים דיוק מרבי, הטורבו לוקח באחוז בודד.

איך מריצים

המודל שוקל 2.8 גיגה בייט ומחזיק 756 מיליון פרמטרים, כך שאפשר להריץ אותו בקלות על כרטיס מסך בודד עם 6 עד 8 גיגה זיכרון וידאו. הוא עובד ישירות בספריית transformers מגרסה 4.39, ויש לו התאמות מוכנות לתוך whisper.cpp, Faster-Whisper ו־Candle אם רוצים לחסוך עוד משאבים. אפשר גם להפעיל עליו Flash Attention 2 או SDPA שמגיעה מובנית בפייתורץ׳.

אם יש לכם שרת מקומי עם מאיץ גרפי סביר, שווה להריץ לבד. אם אתם מעבדים עשרות שעות בודדות בחודש ואין לכם תשתית ענן דולקת, עדיף להשתמש ב־API חיצוני של מודל קיים מאשר לתחזק שרת בשביל זה.

from transformers import pipeline

pipe = pipeline("automatic-speech-recognition", model="distil-whisper/distil-large-v3.5")
print(pipe("שלום"))

הרישיון

המודל שוחרר תחת רישיון MIT. מותר לקחת אותו, לשנות אותו, להטמיע במוצר מסחרי סגור ולמכור אותו כחלק מתוכנה בלי לשלם תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗