GPT
D

distil-small.en

קוד פתוח

distil-whispermit2023-12-06

  • transformers
  • pytorch
  • tensorboard
  • onnx
  • safetensors

גרסה מזוקקת וקומפקטית של וויספר באנגלית, עם 166 מיליון פרמטרים בלבד. הוא מיועד למי שחייב להריץ תמלול על מכשירי קצה או תחת מגבלות זיכרון קשות בלי לשלם על שרתים יקרים.

  • 166Mפרמטרים
  • 5.2 GBמשקל הקבצים
  • 12,326הורדות בחודש
  • 118לייקים

מה זה

מדובר במודל התמלול הקטן ביותר בסדרת Distil-Whisper. הוא נבנה על בסיס whisper-small.en הרגיל, אבל שומר על מהירות גבוהה פי 5.6 לעומת large-v2 של OpenAI. כדי להשיג את זה, המפתחים הקפיאו את הקידוד המקורי וצמצמו את שכבות הפענוח, שאחראיות על רוב זמן הריצה, לארבע שכבות בלבד.

במדדי שגיאות מילים הוא מגיע ל־12.1% בקטעים קצרים ו־12.8% בקטעים ארוכים. זה אומר שהוא מפספס יותר מגרסאות המדיום והלארג׳ המזוקקות, אבל עדיין נשאר במרחק של כ־3% שגיאה בלבד מהמודל הענק large-v2, תוך חיסכון עצום במשאבים.

בנוסף לתמלול ישיר, הוא תומך בפענוח ספקולטיבי. בתצורה הזו הוא משמש כעוזר מהיר לצד מודל וויספר מלא, מה שמאפשר לקבל בדיוק את אותן התוצאות של המודל הגדול אבל במהירות כפולה.

מתאים ל

  • תמלול מקומי בדפדפן

    רץ ישירות בצד לקוח דרך ספריית JS בלי לשלוח שום קובץ קול לשרת חיצוני.

  • עוזר לפענוח ספקולטיבי

    מאיץ פי שניים ריצה של וויספר מלא על ידי חיזוי טוקנים מקדים ואימות מהיר.

  • מכשירי קצה ומחשבים ישנים

    מתאים לסביבות דלות זיכרון שבהן מודלים של 700 מיליון פרמטרים פשוט קורסים.

איפה זה נופל

הוא מוגבל לאנגלית בלבד. ניסיון להזין לו עברית או כל שפה אחרת ייכשל לחלוטין. מעבר לזה, הכרטיס עצמו מדגיש שאם יש לכם מספיק זיכרון, עדיף לבחור ב־distil-medium.en או ב־distil-large-v2. הגרסאות הגדולות יותר משתמשות בשתי שכבות פענוח בלבד ולכן הן גם מהירות יותר מהמודל הזה וגם משיגות אחוזי דיוק גבוהים יותר. כאן נדרשו ארבע שכבות כדי למנוע קריסה באיכות, מה שפגע במהירות היחסית.

שאלות
נפוצות

האם כדאי להעדיף אותו על פני distil-medium.en?

רק אם יש לכם מגבלת RAM או VRAM חמורה. distil-medium.en מהיר יותר ממנו ומספק פחות שגיאות תמלול, כי הוא משתמש בפחות שכבות פענוח.

האם המודל יודע לתמלל הקלטות ארוכות?

כן. הפייפליין תומך בחלוקה למקטעים של 15 שניות, ואלגוריתם הקיטוע הזה מגיע לביצועים מהירים עד פי תשעה לעומת המימוש המקורי של OpenAI.

איך מריצים

קל להרים אותו בקוד פייתון דרך transformers באמצעות הפייפליין הרגיל, או ישירות דרך חבילת openai-whisper הרשמית. הודות למשקל הנמוך, הוא רץ בלי בעיה על מעבדים פשוטים, בתוך הדפדפן דרך Transformers.js, או מקומית על מחשבי מק וחלונות בעזרת Whisper.cpp.

אם יש לכם כרטיס מסך מודרני מומלץ להפעיל Flash-Attention 2 או BetterTransformers כדי לסחוט ממנו ביצועים מקסימליים. שווה להחזיק אותו על שרת פרטי או על מכשיר הקצה רק כשאתם חייבים לחסוך עלויות תעבורה, פרטיות מלאה או פעולה ללא אינטרנט. לתעבורה אפסית עדיף לפנות ל־API חיצוני מוכן במקום לתחזק תשתית.

from transformers import pipeline

pipe = pipeline("automatic-speech-recognition", model="distil-whisper/distil-small.en")
print(pipe("שלום"))

הרישיון

המודל שוחרר תחת רישיון MIT. מותר להשתמש בו לצרכים מסחריים ופרטיים, לשנות אותו, להפיץ אותו ולהטמיע אותו במוצרים סגורים בלי לשלם תמלוגים. התנאי היחיד הוא שמירת הודעת זכויות היוצרים ונוסח הרישיון המקורי בקוד או בהפצה שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗