GPT
A

Audio8-ASR-0.1B

קוד פתוח

Edge0cc-by-nc-4.02026-07-10

  • transformers
  • safetensors
  • arkasr
  • text-generation
  • automatic-speech-recognition

מודל תמלול זעיר שמכוון למכשירי קצה ומשלב מפענח שפה של 100 מיליון פרמטרים בלבד. הוא מתאים למי שרוצה תמלול מהיר ומקומי בלי שרתים כבדים.

  • 324Mפרמטרים
  • 32,768טוקנים בהקשר
  • 708 MBמשקל הקבצים
  • 6,367הורדות בחודש

מה זה

הארכיטקטורה מחברת בין מקודד קול שמבוסס על Qwen3-ASR לבין מפענח טקסטואלי של 8 שכבות בסגנון Qwen, עם סך כולל של 324 מיליון פרמטרים בכל הרשת. השילוב הזה שומר על קובץ משקלים של 708 מגה בייט בלבד, מה שמאפשר לו להציג מהירות תמלול גבוהה מאוד, כפי שנמדד בכרטיס עם קצב של מאות שעות שמע בשעה אחת על חומרת שרת.

בבדיקות Open ASR Leaderboard באנגלית הוא מציג ממוצע שגיאות מילים של 7.03 אחוזים על פני שבעה מאגרי בדיקה ציבוריים, לצד שיעור שגיאות תווים של פחות מתשעה אחוזים בסינית. מעבר לאנגלית וסינית, המודל תומך גם בגרמנית, צרפתית, קוריאנית, יפנית וקנטונזית, וכולל מנגנון לעידוד מילות מפתח בזמן פענוח ללא צורך באימון מחדש.

מתאים ל

  • תמלול מקומי באפליקציות iOS

    ניצול גרסת ה־ANE הייעודית לתמלול פקודות קוליות על האייפון בצריכת זיכרון של כ־200 מגה בייט בלבד.

  • זיהוי פקודות במכשירי קצה

    הפעלת המודל דרך ONNX Runtime על מחשבים זעירים לזיהוי מהיר של משפטים קצרים באנגלית או סינית.

  • תמלול מהיר של קטעי שמע קצרים

    פענוח הודעות קוליות של עד חצי דקה בזכות שילוב מילות מפתח ממוקד ובלי צורך בכרטיס מסך יקר.

איפה זה נופל

החיסרון המרכזי הוא התאמתו הבלעדית לתמלול קצר, כשהדוגמאות וההגדרות חותכות כל קובץ שמע ב־30 שניות. אם תזינו קבצים ארוכים בלי לפרק אותם ידנית, המודל פשוט יקטום את השמע. בנוסף, מנגנון חיזוק מילות המפתח עלול לגרום להטיות יתר בפענוח אם קובעים ערכים גבוהים מדי, ועברית אינה מופיעה ברשימת השפות הנתמכות.

שאלות
נפוצות

האם המודל מתאים לתמלול שיחות בעברית?

לא. רשימת השפות הנתמכות כוללת אנגלית, סינית, צרפתית, גרמנית, יפנית, קוריאנית וקנטונזית בלבד. עברית אינה נתמכת כלל במודל הזה.

איך מתמודדים עם מגבלת 30 השניות לקבצים ארוכים?

המודל מתוכנן לקטעים קצרים וקוטם שמע מעבר ל־30 שניות. כדי לתמלל הקלטה ארוכה, תצטרכו לפצל את הקובץ מראש למקטעים קצרים באמצעות כלי חיצוני לפני שתשלחו אותם למודל.

איך מריצים

המשקל הכולל של 708 מגה בייט אומר שאפשר להריץ אותו כמעט על כל לפטופ מודרני או מעבד גרפי פשוט באמצעות Transformers, בתנאי שמפעילים trust_remote_code. אם אתם מכוונים למובייל, קיימות גרסאות ייעודיות ל־ONNX Runtime שדורשות סביב 1.1 גיגה בייט זיכרון, וחבילה ל־iOS שמנצלת את ה־ANE ומסתפקת בכ־200 מגה בייט זיכרון עבודה.

אין סיבה לשלם ל־API חיצוני אם הצורך שלכם הוא תמלול קצר באחת השפות הנתמכות וחשוב לכם שהמידע יישאר מקומית על המכשיר. מנגד, אם אתם צריכים תמלול שוטף של הרצאות שלמות בלי לחתוך מקטעים מראש, שירות ענן ייעודי יחסוך לכם פיתוח של שכבת חלוקת שמע.

from transformers import pipeline

pipe = pipeline("automatic-speech-recognition", model="Edge0/Audio8-ASR-0.1B")
print(pipe("שלום"))

הרישיון

המודל מופץ תחת רישיון cc-by-nc-4.0. המשמעות ברורה וחדה, אסור לשלב אותו בשום מוצר מסחרי, שירות בתשלום או פעילות שמייצרת הכנסה. הרישיון מאפשר שימוש למחקר, ניסויים ופרויקטים אישיים בלבד, תוך מתן קרדיט מתאים ליוצרים.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗