GPT
Q

Qwen3-ASR-0.6B-hf

קוד פתוח

Qwenapache-2.02026-06-26

  • transformers
  • safetensors
  • qwen3_asr
  • automatic-speech-recognition
  • zh

יש כאן גם סקירה על Qwen עצמו.

תמלול דיבור קל משקל ומהיר במיוחד למי שצריך להריץ הכל מקומית. הוא תומך בהזרמה, זיהוי שפה והזרקת מונחים מראש בלי לתפוס זיכרון כבד.

  • 782Mפרמטרים
  • 65,536טוקנים בהקשר
  • 1.5 GBמשקל הקבצים
  • 114,647הורדות בחודש

מה זה

מדובר במודל זיהוי דיבור מבוסס ארכיטקטורת Qwen3-Omni ששוקל ג'יגה וחצי בלבד. הוא יודע לקבל קבצי שמע או הזרמה חיה, לזהות לבד את השפה מתוך 30 שפות ו־22 ניבים, ולתמלל דיבור רגיל, שירה או שירים עם מוזיקת רקע. אפשר לדחוף לו בהנחיה מילים ספציפיות כמו שמות אנשים או מונחים מקצועיים כדי שלא יתבלבל בהם בזמן היצירה.

בבדיקות מול בנצ'מרקים של HuggingFace הוא רושם שיעור שגיאות מילים ממוצע של 6.31 אחוזים, לעומת 5.59 אחוזים באח הגדול שלו של 1.7 מיליארד פרמטרים. ההבדל מורגש בעיקר בהקלטות קשות או פגישות מרובות דוברים, שם הוא מגיע ל־10.57 אחוז שגיאה ב־AMI, אבל בדיבור ברור כמו Librispeech הוא כמעט מדויק לגמרי עם פחות משני אחוזי שגיאה.

מתאים ל

  • תמלול שיחות תמיכה באנגלית

    זיהוי מהיר של אנגלית עם מבטאים שונים והזרקת שמות מותגים ישירות לפרומפט למניעת טעויות.

  • תמלול שמע בהזרמה בזמן אמת

    מודל קל משקל שתומך ב־streaming ויכול לרוץ מקומית על חומרה זולה בלי ליצור צוואר בקבוק.

  • עיבוד ארכיוני פודקאסטים

    קצב עיבוד של פי 2000 במקביליות גבוהה, שמסיים שעות של אודיו בתוך שניות ספורות.

איפה זה נופל

החיסרון המרכזי לקורא הישראלי ברור מיד: עברית פשוט לא קיימת ברשימת השפות הנתמכות. המודל מכסה ערבית, אנגלית ושפות אירופאיות ואסיאתיות רבות, אבל שמע בעברית לא יעבוד פה בלי אימון ייעודי מאפס.

בנוסף, אם אתם חייבים חותמות זמן מדויקות ברמת המילה, המודל הזה לא מייצר אותן לבד. תצטרכו להוריד ולהריץ מודל ייעודי נפרד של יישור כפוי, וגם הוא תומך ב־11 שפות בלבד.

אותה משפחה

Qwen3-ASR יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בתמלול שיחות בעברית?

לא. עברית אינה נכללת ברשימת 30 השפות הנתמכות של המודל. ניסיון להזין לו אודיו בעברית ייכשל או יניב טעויות גסות, ולכן לפרויקטים מקומיים תצטרכו לחפש חלופה אחרת.

איך מוציאים חותמות זמן לכל מילה כדי לייצר כתוביות?

המודל הנוכחי מחזיר טקסט בלבד ולא מתזמן מילים. כדי לחלץ זמנים מדויקים צריך להשתמש במודל המשלים Qwen3-ForcedAligner-0.6B כצעד שני בצנרת העבודה.

האם שווה לקחת את גרסת ה־0.6B במקום ה־1.7B?

אם שרת היעד מוגבל במשאבים או שאתם צריכים תפוקה מהירה בעלות חומרה מינימלית, גרסת ה־0.6B נותנת מענה מצוין. אם ההקלטות כוללות רעשי רקע חזקים או דוברים שעולים זה על זה, שיעור השגיאות של ה־1.7B נמוך יותר ושווה את תוספת הזיכרון.

איך מריצים

כדי להריץ אותו צריך התקנה של ספריית transformers מגרסה 5.13.0 ומעלה. בגלל הגודל הצנוע, 782 מיליון פרמטרים ומשקל קבצים של 1.5 גיגה, כרטיס מסך בסיסי עם 4 עד 6 גיגה של VRAM יחזיק אותו בלי שום מאמץ, ואפשר לעשות לו אופטימיזציה עם torch.compile שמאיצה את הריצה פי 2.4 על חומרת שרת.

המפתחים מדווחים על קצב של פי 2000 מזמן אמת בריצה במקביל של 128 בקשות. אם אתם צריכים תפוקה גדולה של תמלולים או מערכת שרצה בלי חיבור לרשת, ההרצה העצמית זולה ומהירה בהרבה מפנייה לכל שירות ענן חיצוני. מצד שני, אם אתם מחפשים דיוק מקסימלי בהקלטות מורכבות, שווה לבדוק קודם את גרסת ה־1.7B.

from transformers import pipeline

pipe = pipeline("automatic-speech-recognition", model="Qwen/Qwen3-ASR-0.6B-hf")
print(pipe("שלום"))

הרישיון

הקוד והמשקולות מופצים תחת רישיון Apache 2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי חופשי, שינוי הקוד, הפצה והטמעה במוצרים סגורים, בלי חובה לחשוף את הקוד שלכם, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗