GPT
M

moonshine-tiny

קוד פתוח

moonshine-aimit2024-10-30

  • transformers
  • safetensors
  • moonshine
  • automatic-speech-recognition
  • en

מודל תמלול קטן במיוחד שנועד לפעול ישירות על מעבדים חלשים ומכשירים מוגבלים. הוא מתאים למי שחייב תמלול אנגלי מקומי ומהיר בלי להחזיק שרת יקר או כרטיס מסך ייעודי.

  • 27Mפרמטרים
  • 194טוקנים בהקשר
  • 105 MBמשקל הקבצים
  • 74,610הורדות בחודש

מה זה

מדובר במודל זיהוי דיבור של חברת Useful Sensors, שתוכנן מראש לחומרה זולה ולעיבוד בזמן אמת. עם 27 מיליון פרמטרים ומשקל קבצים של כ־105 מגה בייט, הוא מכוון לרוץ בסביבות שבהן משאבי הזיכרון והחישוב מוגבלים מאוד. הוא אומן על 200,000 שעות של שמע ותמלולים באנגלית מהרשת וממאגרים פתוחים.

המפתחים מעמידים אותו מול מערכות ASR קיימות בסדרי גודל דומים, וטוענים לדיוק גבוה יותר במבחנים סטנדרטיים. המטרה כאן אינה להתחרות בענקי תמלול שדורשים חומרה מסיבית, אלא לתת מענה פרקטי וממוקד למי שצריך תמלול בסיסי וזול בלי לשלוח מידע החוצה.

מתאים ל

  • זיהוי פקודות קוליות

    משקל של 105 מגה מאפשר לו לרוץ על מעבד פשוט ללא כרטיס מסך.

  • תמלול חי במכשירי קצה

    תוכנן לפעול על חומרה זולה בזמן אמת בלי תלות בחיבור לרשת.

  • כלי נגישות לא מקוונים

    מאפשר תמלול אנגלי מקומי במערכות מוגבלות זיכרון.

איפה זה נופל

החיסרון המרכזי הוא הזיות וחזרתיות על מילים. המפתחים מודים שהארכיטקטורה נוטה לייצר טקסט שלא נאמר בשמע, במיוחד בקטעים קצרים או כשיש מילים קטועות בהתחלה או בסוף. אפשר למתן את זה חלקית עם פרמטרים כמו beam search, אבל לא למנוע לגמרי.

בנוסף, הוא מיועד אך ורק לאנגלית. אין תמיכה בעברית, והיוצרים מזהירים מפורשות לא להסתמך עליו בקבלת החלטות קריטית או במשימות כמו זיהוי דוברים שלא נבדקו ביסודיות.

שאלות
נפוצות

האם המודל תומך בתמלול עברית?

לא. המודל אומן והוגדר לעבודה באנגלית בלבד. אם תזינו לו עברית, תקבלו פלט שגוי או הזיות טקסט באנגלית.

האם צריך כרטיס מסך כדי להשתמש בו?

ממש לא. עם 27 מיליון פרמטרים וגודל קבצים של 105 מגה בייט, הוא מיועד מראש לרוץ ישירות על מעבד של מכשיר זול או מחשב פשוט.

האם אפשר להשתמש בו לזיהוי מי הדובר בהקלטה?

לא מומלץ. יוצרי המודל מבהירים שהוא אומן אך ורק לתמלול טקסט, ומזהירים שלא להסתמך עליו למשימות סיווג כמו זיהוי דובר ללא אימון נוסף ובדיקות מעמיקות.

איך מריצים

אתם יכולים לטעון ולהריץ אותו ישירות דרך ספריית transformers הרגילה של פייתון, יחד עם datasets ו־accelerate. גודל הקבצים המזערי אומר שאין שום צורך בכרטיס מסך, והוא יעבוד בקלות על מעבד רגיל, לפטופ פשוט או חומרת קצה מוגבלת.

היוצרים שחררו שתי גרסאות: tiny עם 27 מיליון פרמטרים, ו־base הגדולה יותר עם 61 מיליון. אם המוצר שלכם צריך לתמלל שיחות ארוכות, להתמודד עם שפות אחרות או לספק דיוק מוחלט, עדיף להשתמש ב־API חיצוני ייעודי. הפתרון הזה מיועד אך ורק למקרים שבהם חובה לחסוך בעלויות ולעבד מקומית.

from transformers import pipeline

pipe = pipeline("automatic-speech-recognition", model="moonshine-ai/moonshine-tiny")
print(pipe("שלום"))

הקבצים

7 קבצים במאגר, 105 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הקוד והמשקלים שוחררו תחת רישיון MIT. זהו רישיון פתוח ומתירני לחלוטין, שמאפשר שימוש מסחרי, שינוי של המודל, הפצה מחדש והטמעה במוצרים סגורים. התנאי היחיד הוא שמירת הודעת זכויות היוצרים והרישיון המקורי בקבצים שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗