GPT
M

moonshine-base-ONNX

קוד פתוח

onnx-communitymit2024-12-14

  • transformers.js
  • onnx
  • moonshine
  • automatic-speech-recognition

הסבה מוכנה של מודל תמלול קול שרץ ישירות ב־JavaScript עם Transformers.js. אם אתם צריכים תמלול אודיו מקומי בסביבת Node או בדפדפן בלי תלות בשרתים חיצוניים, זו אופציה קונקרטית.

  • 512טוקנים בהקשר
  • 1.9 GBמשקל הקבצים
  • 16,718הורדות בחודש
  • 38לייקים

מה זה

מדובר במודל לתמלול דיבור שמבוסס על ארכיטקטורת MoonshineForConditionalGeneration והומר לפורמט ONNX. הוא כולל 8 שכבות ומגיע בדיוק מלא של float32, מה שמעמיד אותו על גודל כולל של 1.9 גיגה בייט.

היתרון המרכזי כאן הוא החיבור הישיר ל־Transformers.js. אתם לא צריכים שרת פייתון נפרד או סביבת ריצה מורכבת כדי לעבד קול, אלא טוענים את ה־pipeline ישירות בקוד שלכם. עם זאת, אין בכרטיס המודל שום נתוני השוואה או מדדי דיוק כמו WER, כך שקשה לדעת מראש איך הוא מתמודד מול מודלים אחרים באותו סדר גודל בלי לבדוק אותו על קבצי האודיו שלכם.

מתאים ל

  • תמלול אודיו ב־Node.js

    מאפשר לעבד קבצי קול ישירות בצד השרת ב־JavaScript, בלי להקים תשתית פייתון נפרדת.

  • עיבוד קול מקומי ללא רשת

    מתאים למערכות שחייבות לשמור על פרטיות מלאה ולהריץ את התמלול מקומית על המחשב.

  • אוטומציות של קטעי שמע קצרים

    עובד מעולה על הודעות קוליות ומשפטים בודדים שמתאימים למגבלת ה־512 טוקנים.

איפה זה נופל

הקשר הקלט מוגבל ל־512 טוקנים בלבד, מה שאומר שלא תוכלו לזרוק עליו הקלטות ארוכות בלי לחתוך ולנהל את המקטעים בעצמכם. בנוסף, חבילת הקבצים מפוצלת ל־40 קבצים נפרדים בגלל מבנה ה־ONNX, והמשקל שלה ידרוש משאבים כבדים אם תנסו לדחוף אותה לצד לקוח. אין פה שום פירוט על תמיכה בשפות אחרות חוץ מאנגלית, כך שאין שום הבטחה שהוא יבין עברית או מבטאים כבדים.

שאלות
נפוצות

האם המודל תומך בתמלול בעברית?

הדוגמה היחידה בכרטיס המודל היא באנגלית, ואין שום תיעוד על שפות נוספות שנתמכות. אם המטרה היא תמלול עברית, צריך לבדוק אותו עצמאית לפני שמתחייבים עליו, ולא הייתי בונה על זה מראש.

האם אפשר להריץ אותו ישירות בדפדפן?

טכנית כן, כי הספרייה תומכת בדפדפן, אבל המשקל הכולל של 1.9 גיגה בייט הופך את זה לבעייתי מאוד עבור רוב המשתמשים. בשביל הרצה בדפדפן כדאי לחפש גרסאות מכווצות או מודלים קלים בהרבה.

איך מריצים

ההרצה פשוטה מאוד ודורשת התקנה של חבילת transformers מ־NPM וקריאה לפונקציית pipeline עם מזהה המודל. הקוד מקבל קישור לקובץ אודיו ומחזיר את הטקסט המתומלל באופן ישיר.

הקבצים שוקלים כמעט 2 גיגה בייט, כך שצריך לוודא שיש מספיק זיכרון עבודה פנוי בשרת או במכשיר הקצה שמריץ אותו. אם אתם מתכננים להריץ את זה בדפדפן של משתמשי קצה על חיבור סלולרי, זמני ההורדה יהיו כבדים ועדיף לפנות ל־API ייעודי שיעשה את התמלול בענן.

pip install -U huggingface_hub
hf download onnx-community/moonshine-base-ONNX

הקבצים

40 קבצים במאגר, 1.9 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל משוחרר ברישיון MIT. זה נותן לכם חופש מלא להשתמש בו, לשלב אותו במוצרים מסחריים, לשנות אותו ולהפיץ אותו כחלק מהמערכת שלכם, בתנאי שאתם שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗