GPT
A

ARK-ASR-0.6B

קוד פתוח

Edge0apache-2.02026-05-25

  • transformers
  • safetensors
  • arkasr
  • text-generation
  • automatic-speech-recognition

מודל תמלול קומפקטי שמחבר מקודד מבוסס וויספר למפענח טקסטואלי, ומביא דיוק שמנצח מודלים מקבילים באנגלית ובסינית. הוא פונה למי שרוצה הרצה מקומית קלה בלי לוותר על איכות.

  • 1.3Bפרמטרים
  • 32,768טוקנים בהקשר
  • 2.4 GBמשקל הקבצים
  • 1,731הורדות בחודש

מה זה

השם אומר 0.6B, אבל בפועל מדובר על 1.3 מיליארד פרמטרים כי יש פה שילוב של שני רכיבים. מקודד אודיו ייעודי בסגנון וויספר ומפענח של Qwen2, שמחוברים יחד דרך מתאם פנימי. האימון שלו לא התבסס רק על תמלולים קיימים אלא על זיקוק ממודל מורה חזק יותר, שנתן ציונים לפלטים שהמודל הזה יצר בעצמו תוך כדי ריצה.

התוצאות במבחנים מראות שהוא משיג שיעור שגיאות ממוצע של 6.55% באנגלית, לעומת 6.93% של Qwen3-ASR באותו סדר גודל, ומתקרב למודלים עם 1.7 מיליארד פרמטרים. בסינית התוצאה עומדת על 4.30% מול 4.36% של המתחרה. זה לא שיפור עצום, אבל בתוך מגבלות הגודל האלו כל חצי אחוז שגיאה פחות הוא רווח נקי למי שרוצה דיוק מרבי בחומרה צנועה.

מתאים ל

  • תמלול שיחות באנגלית

    משיג אחוזי שגיאה נמוכים בהקלטות פיננסיות ושיחות, מתאים לשרת פנימי קטן.

  • מערכות תמלול לשוק האירופי

    תומך ברשימה ארוכה של שפות אירופיות ומאפשר ריצה מקומית ופרטית לחלוטין.

  • עיבוד אודיו בקצה

    משקל של 2.4 ג'יגה בייט מאפשר להריץ אותו ישירות על מחשבים אישיים ללא ענן.

איפה זה נופל

החיסרון הברור ביותר למפתח בישראל הוא היעדר מוחלט של עברית. הרשימה כוללת 19 שפות, בעיקר אירופאיות יחד עם סינית, יפנית וקוריאנית, אבל ערבית ועברית בחוץ לגמרי. לא הייתי נוגע בזה לפרויקטים מקומיים.

בנוסף, הטעינה שלו נשענת על קוד מרוחק בתוך המאגר, מה שמחייב בדיקת אבטחה של הקבצים לפני שמריצים אותם על שרת ארגוני. במבחני האנגלית הוא עדיין מתקשה בשיחות מרובות משתתפים עם 11.54% שגיאה במבחן AMI, כך שאודיו רועש או שיחות ועידה ידרשו בדיקה קפדנית.

אותה משפחה

ARK-ASR יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

למה מופיע 0.6B בשם אם יש לו 1.3 מיליארד פרמטרים?

השם מתייחס לגודל של מפענח הטקסט בלבד, שמבוסס על שפת Qwen2. בנוסף אליו פועל מקודד שמע ייעודי שמוסיף עוד כ־600 מיליון פרמטרים, ולכן המשקל הכולל של המודל כפול ממה שנראה במבט ראשון.

האם אפשר להשתמש בו לזיהוי קול בעברית?

לא. המודל אומן ותומך ב־19 שפות בלבד, בהן סינית, אנגלית ומבחר שפות אירופיות, ועברית אינה נכללת בהן כלל.

איך מריצים

המודל שוקל 2.4 ג'יגה בייט בפורמט safetensors, כך שכרטיס מסך בסיסי עם 6 עד 8 ג'יגה זיכרון יריץ אותו בקלות בפורמט float16, ואפשר לעבוד איתו גם באצווה גדולה של עשרות דגימות במקביל דרך Transformers. שימו לב שהוא דורש הרצת קוד מותאם אישית דרך הדגל trust_remote_code וקצב הדגימה של האודיו חייב להיות 16 קילוהרץ.

אם כל מה שאתם צריכים זה לתמלל עשרות שעות ביום של שפות נפוצות, שירות ענן חיצוני עשוי לחסוך לכם תחזוקה. הרצה עצמית שווה את זה רק אם החומר רגיש, אם אתם מריצים במנות קבועות, או כשצריך לתמלל אופליין בתוך סביבה סגורה בלי תלות באינטרנט.

from transformers import pipeline

pipe = pipeline("automatic-speech-recognition", model="Edge0/ARK-ASR-0.6B")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache 2.0 מלא. אפשר להשתמש בו ליישומים מסחריים, לשנות את הקוד ולהפיץ אותו הלאה בחינם או בתשלום, בלי לפתוח את הקוד שלכם. הדרישה היחידה היא לשמור על הודעת זכויות היוצרים ועותק הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗