GPT
M

moonshine-base

קוד פתוח

moonshine-aimit2024-11-02

  • transformers
  • safetensors
  • moonshine
  • automatic-speech-recognition
  • en

תמלול קול בזמן אמת על חומרה חלשה ובלי לגעת בענן. הוא תופס 237 מגה-בייט בלבד ורץ ישירות דרך ספריית transformers.

  • 62Mפרמטרים
  • 194טוקנים בהקשר
  • 237 MBמשקל הקבצים
  • 19,177הורדות בחודש

מה זה

מדובר במודל זיהוי דיבור של חברת Useful Sensors, שמבוסס על ארכיטקטורת sequence to sequence עם 62 מיליון פרמטרים. המפתחים אימנו אותו על 200,000 שעות של הקלטות ותמלולים באנגלית מהרשת וממאגרים פתוחים. המטרה המרכזית שלו היא לספק ביצועים עדיפים על פני מודלים קיימים בגודל דומה, במיוחד עבור מוצרים שצריכים לעבד קול מקומית.

הוא מיועד לאנגלית בלבד, כך שלא תמצאו כאן תמיכה בעברית או בשפות אחרות. הכוח שלו טמון באיזון בין גודל פיזי זעיר לבין רמת דיוק שמספיקה לתמלול שוטף. הוא מתאים במיוחד למכשירים מוגבלים בזיכרון שלא יכולים לארח מודלים ענקיים כמו Whisper בגדלים המתקדמים שלו.

מתאים ל

  • תמלול חי במכשירי קצה

    הוא שוקל מעט מאוד ומאפשר תמלול פקודות דיבור באנגלית בזמן אמת ישירות על חומרה פשוטה.

  • עוזרי נגישות אופליין

    מספק כתוביות לדיבור באנגלית במכשירים ניידים ללא צורך בחיבור רשת או בתשלום לענן.

  • עיבוד אודיו מקומי ופרטי

    מאפשר לתמלל שיחות באנגלית בלי להוציא קובצי קול מחוץ לרשת המקומית של הארגון.

איפה זה נופל

היוצרים מודים בפירוש שהמודל נוטה להזיות ולחזרות מיותרות על טקסט, בעיקר בגלל הניסיון שלו לחזות את המילה הבאה במקביל להאזנה. הבעיה הזו מחמירה בקטעי אודיו קצרים במיוחד או בהקלטות שבהן מילים נחתכו בהתחלה או בסוף. אפשר למתן את זה חלקית בעזרת beam search וכוונון טמפרטורה, אבל זה לא פותר את הבעיה לגמרי.

מעבר לכך, אין תמיכה בשום שפה מלבד אנגלית, וחלון ההקשר מוגבל ל־194 טוקנים. המודל גם לא מיועד לזיהוי דוברים או סיווג רגשי בלי שתבצעו עליו כוונון עדין בעצמכם.

אותה משפחה

moonshine יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם הוא מתאים לתמלול שיחות בעברית?

לא. המודל אומן אך ורק על 200,000 שעות של קול ותמלול באנגלית. הוא לא יזהה עברית, ועבור שפות שאינן אנגלית צריך מודל אחר לגמרי.

איך אפשר לצמצם את בעיית ההזיות והחזרות בטקסט?

הכרטיס ממליץ להשתמש בחיפוש אלומה (beam search) ובכוונון מדדי טמפרטורה בזמן הדגימה. בנוסף, רצוי להימנע משליחת מקטעי אודיו קטועים מדי.

איך מריצים

המודל שוקל 237 מגה-בייט בלבד, כך שלא צריך שרת כבד או כרטיס מסך יקר. כל מעבד מודרני ממוצע מריץ אותו בלי בעיה דרך הספרייה הרגילה של transformers עם שימוש ב־accelerate לטעינה מהירה. קיים גם דגם tiny קטן עוד יותר עם 27 מיליון פרמטרים, אבל גרסת ה־base נותנת איזון עדיף בין גודל לאיכות.

אם אתם מתמללים אנגלית בלבד על מכשירי קצה, לפטופים ישנים או שרתי edge קטנים, אין סיבה לשלם על API חיצוני. הפנייה ל־API חיצוני מוצדקת בעיקר כשאתם חייבים לתמוך בשפות אחרות חוץ מאנגלית, או כשאתם זקוקים לתכונות כמו זיהוי דוברים שלא מובנות כאן.

from transformers import pipeline

pipe = pipeline("automatic-speech-recognition", model="moonshine-ai/moonshine-base")
print(pipe("שלום"))

הקבצים

7 קבצים במאגר, 237 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

רישיון MIT פתוח לחלוטין. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד והמשקלים, לשלב אותו במוצרים סגורים ולהפיץ אותם בחופשיות. התנאי היחיד הוא שמירת הודעת זכויות היוצרים והרישיון המקורי בקוד.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗