GPT
D

distilhubert

קוד פתוח

ntu-spmlapache-2.02022-03-02

  • transformers
  • pytorch
  • safetensors
  • hubert
  • feature-extraction

גרסה מזוקקת וקלה במיוחד לחילוץ מאפיינים מקבצי קול באנגלית. הפתרון מיועד למי שצריך ייצוג אודיו מהיר בלי לסחוב מודלים כבדים בזיכרון.

  • 23Mפרמטרים
  • 179 MBמשקל הקבצים
  • 59,062הורדות בחודש
  • 39לייקים

מה זה

מדובר במודל שנוצר באמצעות זיקוק של HuBERT המקורי כדי לחסוך במשאבים. עם 23 מיליון פרמטרים ושתי שכבות בלבד, הוא חותך בערך 75 אחוז מהגודל של המקור ורץ מהר בהרבה. המטרה העיקרית שלו היא חילוץ ייצוגים ווקטוריים של דיבור, והוא אומן בלמידה עצמית על אודיו בלבד.

הוא מיועד לשמש כבסיס למשימות עיבוד קול שונות. במקום להחזיק מודל ענק רק בשביל לקבל וקטורים של דיבור, מקבלים משקל קובץ של 179 מגה בייט שעושה עבודה דומה מאוד למקור בעשרה מבחני ביצועים שונים באנגלית.

מתאים ל

  • חילוץ וקטורים לקול במכשיר קצה

    המשקל הקל מאפשר להריץ אותו ישירות על חומרה חלשה בלי צריכת זיכרון מוגזמת.

  • בסיס למודל זיהוי דיבור קל

    הוא נותן נקודת פתיחה טובה לאימון מזהה דיבור באנגלית כשמחברים לו ראש CTC.

  • סיווג אודיו וזיהוי דוברים

    הייצוגים המזוקקים מספיקים למשימות קוליות במעט זמן אימון ומשאבים.

איפה זה נופל

הוא לא מגיע מוכן לתמלול. אין לו טוקנייזר ואי אפשר לזרוק עליו הקלטה ולקבל טקסט בלי לבנות טוקנייזר ולאמן שכבת סיווג ייעודית על מידע מתויג. בנוסף, הוא אומן רק על אנגלית ובקצב דגימה מדויק של 16 קילו הרץ. כל אודיו בקצב אחר או בשפה אחרת כמו עברית יחייב המרה מוקדמת או אימון מחדש, אחרת התוצאות יהיו חסרות ערך.

שאלות
נפוצות

האם אפשר להשתמש בו ישירות כדי לקבל טקסט מהקלטה?

לא. המודל מחזיר רק וקטורים ולא מילים, כי אין לו רכיב טוקנייזר מובנה. כדי לתמלל צריך לבנות טוקנייזר ולאמן מעליו שכבה מתאימה עם טקסט מתויג.

מה צריך לוודא לגבי קובץ הקול לפני שמזינים אותו?

האודיו חייב להיות בדיוק בקצב דגימה של 16 קילו הרץ ובשפה האנגלית. אם הקובץ שלכם הוקלט באיכות אחרת, תצטרכו להמיר אותו לפני השליחה למודל.

איך מריצים

טוענים אותו ישירות דרך ספריית transformers בפייתון, כשהוא משתמש במחלקות של HubertModel או HubertForCTC אם מאמנים אותו לזיהוי דיבור. בגלל הגודל המזערי שלו, אפשר להריץ אותו בלי שום בעיה על כל מעבד סטנדרטי של מחשב נייד או שרת פשוט, בלי להזדקק למעבד גרפי ייעודי.

אין שום צורך לפנות לשרותי ענן חיצוניים או לשלם על קריאות רשת בשביל מודל כזה. שווה להחזיק אותו מקומית בתוך התהליך שלכם, אלא אם מראש כל התשתית שלכם כבר נשענת על ספק צד שלישי לתמלול מלא.

from transformers import pipeline

pipe = pipeline("feature-extraction", model="ntu-spml/distilhubert")
print(pipe("שלום"))

הקבצים

6 קבצים במאגר, 179 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא apache-2.0, מה שאומר שמותר להשתמש בו במוצרים מסחריים, לשנות אותו ולהפיץ אותו חופשי. התנאי העיקרי הוא שמירת הקרדיט והודעת הרישיון המקורית בקוד או בהפצה שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗