GPT
A

ARK-ASR-3B

קוד פתוח

Edge0apache-2.02026-06-22

  • transformers
  • safetensors
  • arkasr
  • text-generation
  • automatic-speech-recognition

מודל תמלול שמחבר מקודד קול מבוסס וויספר ישירות לתוך מפענח שפה של קוון. הוא מיועד למי שחייב דיוק גבוה מאוד באנגלית או סינית עם שרת עצמאי ומהיר.

  • 4.1Bפרמטרים
  • 32,768טוקנים בהקשר
  • 7.6 GBמשקל הקבצים
  • 16,666הורדות בחודש

מה זה

המודל תופס נפח של ארבעה מיליארד פרמטרים ומבצע זיהוי דיבור על בסיס ארכיטקטורת רגרסיה עצמית. במקום להשתמש בוויספר רגיל מקצה לקצה, החוקרים לקחו מקודד שמע, חיברו אותו עם מתאם לינארי פשוט, והזריקו את הווקטורים של האודיו לתוך מודל שפה של קוון. השיטה הזו נותנת למפענח לנצל את הידע השפתי הרחב שכבר קיים במודל שפה כללי כדי להבין הקשר בצורה טובה יותר.

במדדי הדיוק באנגלית קצרה הוא מציג שגיאת מילים ממוצעת של 5.04 אחוזים על פני מגוון מבחנים מוכרים. באודיו נקי ומסודר כמו ליבריספיץ' הוא כמעט לא מפספס עם שגיאה של אחוז בודד, אבל בהקלטות מורכבות של פגישות ושיחות פיננסיות השגיאה קופצת לכיוון שמונה אחוזים ומעלה. לצד זה, בריצות אצווה מדווח יחס מהירות תמלול גבוה במיוחד של פי 490 מזמן אמת.

מתאים ל

  • תמלול שיחות באנגלית

    דיוק של חמישה אחוזי שגיאה במגוון מבחנים הופך אותו לבחירה טובה לעיבוד שיחות מוקלטות באנגלית.

  • שרת תמלול מהיר בווי-אל-אל-אם

    הקוד כולל מתאם מוכן עם נקודת קצה תואמת אופן איי-איי שמאפשרת להחליף ספק ענן בלי לשנות קוד בלקוח.

  • זיהוי דיבור בסינית

    תוצאות המדידה מראות פחות משני אחוזי שגיאה במאגרי דיבור בסינית, תחום שבו רוב המודלים המערביים חלשים.

איפה זה נופל

החיסרון המרכזי למשתמש בארץ הוא היעדר מוחלט של עברית מרשימת השפות הנתמכות. המודל מתמקד בשפות אירופיות נבחרות, סינית, קוריאנית ויפנית בלבד, כך שלתמלול מקומי הוא פשוט לא רלוונטי. מעבר לזה, המודל מחייב קוד מרוחק מותאם אישית כדי לבצע סינון לטוקנים ולנהל את מסכות ההפקה, מה שמונע שילוב חלק בספריות שחוסמות קוד חיצוני משיקולי אבטחה.

אותה משפחה

ARK-ASR יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל יודע לתמלל הקלטות בעברית?

לא. רשימת השפות המוגדרת במודל כוללת תשע עשרה שפות שונות, בעיקר שפות אירופיות נפוצות, סינית, יפנית וקוריאנית. עברית אינה נתמכת, וניסיון להזין אודיו בעברית יפיק ג'יבריש או ניסיון כושל למפות את הצלילים לשפה זרה.

למה נדרש אישור הרצת קוד מרוחק בטעינה?

המודל משלב ארכיטקטורה לא סטנדרטית שמחברת מקודד אודיו ישירות למפענח של קוון דרך שכבת מתאם. ההיגיון שמחבר בין החלקים ומבצע את מניפולציית הטוקנים יושב בקוד חיצוני ולא בספריית הבסיס הרגילה, ולכן המערכת חייבת אישור מפורש להריץ אותו.

איך מריצים

קובצי המשקלים דורשים הורדה של 7.6 גיגה בייט בפורמט בטוח. כדי להריץ אותו בפורמט חצי דיוק נדרש כרטיס מסך עם לפחות שמונה עד עשרה גיגה בייט זיכרון רק למודל עצמו, ובפועל עדיף כרטיס של 16 גיגה בייט כדי להחזיק תור בקשות פעיל בלי להיחנק. מי שלא מחזיק חומרה כזו ימצא שקריאה לשירות ענן מנוהל תהיה פשוטה וזולה יותר.

ההפעלה המקומית נעשית דרך הקוד הייעודי של הפרויקט שכולל תמיכה מובנית בווי-אל-אל-אם. התשתית הזו חושפת ממשק רשת שתואם למבנה הבקשות של אופן איי-איי, מה שמקל על החלפה של שירותי תמלול קיימים. חשוב לזכור שהטעינה מחייבת אישור הרצת קוד מרוחק, כך שאי אפשר להסתמך רק על ספריות סטנדרטיות בלי לבדוק מה רץ.

from transformers import pipeline

pipe = pipeline("automatic-speech-recognition", model="Edge0/ARK-ASR-3B")
print(pipe("שלום"))

הרישיון

הרישיון הוא אפאצ'י שתיים אפס. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו כחלק ממוצר סגור, בתנאי ששומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗