GPT
D

distil-large-v3

קוד פתוח

distil-whispermit2024-03-21

  • transformers
  • jax
  • tensorboard
  • onnx
  • safetensors

גרסה מזוקקת של Whisper large-v3 שמציעה מהירות גבוהה בהרבה בלי לשלם בדיוק התמלול. היא מיועדת למי שצריך תמלול אנגלית מהיר מקומית או בשרת.

  • 756Mפרמטרים
  • 11.7 GBמשקל הקבצים
  • 540,347הורדות בחודש
  • 380לייקים

מה זה

זהו מודל תמלול שמבוסס על זיקוק ידע מגרסת large-v3 המקורית של OpenAI, ומכיל כמחצית מכמות הפרמטרים עם 756 מיליון פרמטרים ב־32 שכבות. הוא נוצר כדי לפתור את בעיית האיטיות הכבדה של מודלי שמע גדולים מבלי לאבד את איכות התוצאה.

במדידות שנעשו על אודיו ארוך, המודל מהיר פי 6.3 מהמודל המקורי, וההבדל ברמת הדיוק עומד על פחות מאחוז אחד של שיעור שגיאות מילים. הוא גם מתקן נפילה שהייתה בגרסת distil-large-v2 הקודמת, ומציג שיפור של 4.8 אחוזים בדיוק בעבודה עם אלגוריתם החלון הרציף. בנוסף, אפשר להריץ אותו כעוזר פענוח לצד המודל המקורי, מה שמכפיל את המהירות ומבטיח תוצאה זהה לחלוטין.

מתאים ל

  • תמלול שיחות והרצאות באנגלית

    הוא מטפל באודיו ארוך ברמת דיוק קרובה למקור ובמהירות גבוהה פי כמה.

  • האצת צינור Whisper קיים

    הוא משמש כמודל עזר לפענוח ספקולטיבי כדי להכפיל מהירות בלי שינוי בטקסט.

  • תמלול מקומי ב־whisper.cpp

    המשקלים הותאמו מראש לעבודה מהירה גם על מעבדי M1 ללא צורך בענן.

איפה זה נופל

המגבלה המרכזית היא שפה. המודל אומן על אנגלית בלבד, כך שהוא לא יעזור בכלל למי שמחפש לתמלל עברית או שפות אחרות, בניגוד לגרסת המקור הרב-לשונית. מעבר לכך, למרות התוצאות הטובות, שיעור השגיאות באודיו קצר עדיין מעט פחות טוב מזה של large-v3 המקורי, ועומד על 9.7 אחוז מול 8.4 אחוז.

אותה משפחה

distil-large יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בתמלול הקלטות בעברית?

לא. מודל זה שוחרר עבור השפה האנגלית בלבד. אם תזינו לו קול בעברית תקבלו ג'יבריש או ניסיונות תעתיק פונטי באנגלית, ועבור עברית עדיף להישאר עם Whisper large-v3 הרב-לשוני הרגיל.

מה עדיף לי, אלגוריתם רציף או חלוקה למקטעים?

אם אתם מתמללים קובץ ארוך בודד והמהירות קריטית, חלוקה למקטעים מהירה יותר משמעותית. אם אתם מעבדים קבצים במקבצים או שהדיוק הוא הדבר הכי חשוב לכם, עדיף להשתמש באלגוריתם הרציף שמספק עד חצי אחוז פחות שגיאות.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־11.7 גיגה בייט בדיוק float16, מה שדורש כרטיס מסך ייעודי עם מספיק זיכרון וידאו כדי לטעון אותו ולעבד מקטעים בנוחות. אפשר להריץ אותו ישירות דרך ספריית transformers החל מגרסה 4.39, או להשתמש במימושים קלים כמו Faster-Whisper, whisper.cpp או Candle ב־Rust.

אם יש לכם מעבד גרפי שתומך ב־Flash Attention 2 כדאי להפעיל אותו כדי לקצר זמנים, ובסביבות פשוטות יותר עדיף להסתמך על תמיכת ברירת המחדל של PyTorch ב־SDPA. מי שצריך לעבד קבצים בודדים בלי לתחזק תשתית GPU כבדה יעדיף כנראה לפנות לשירות מנוהל חיצוני.

from transformers import pipeline

pipe = pipeline("automatic-speech-recognition", model="distil-whisper/distil-large-v3")
print(pipe("שלום"))

הרישיון

הפרויקט מופץ ברישיון MIT, מה שנותן חופש מוחלט כמעט לכל שימוש כולל מסחרי. אתם יכולים לשלב אותו במוצר פנימי או מסחרי, לשנות את הקוד ולהפיץ אותו, כל עוד שומרים על הודעת זכויות היוצרים המקורית והרישיון בתוך העותקים שתספקו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗