GPT
Q

Qwen3-ASR-0.6B

קוד פתוח

Qwenapache-2.02026-01-28

  • safetensors
  • qwen3_asr
  • automatic-speech-recognition
  • eval-results

יש כאן גם סקירה על Qwen עצמו.

מודל תמלול קטן ומהיר שמזהה שפה ודיבור ב־30 שפות ו־22 דיאלקטים סיניים. הוא מתאים למי שחייב תפוקה גבוהה וזמני תגובה אפסיים על חומרה מקומית צנועה.

  • 938Mפרמטרים
  • 1.8 GBמשקל הקבצים
  • 761,070הורדות בחודש
  • 353לייקים

מה זה

הגרסה הזו מגיעה עם כ־938 מיליון פרמטרים ומשקל קבצים של 1.8 גיגה־בייט בלבד. בניגוד לאחיו הגדול יותר בנפח 1.7 מיליארד פרמטרים, הדגם הזה נבנה מראש לפשרת דיוק מול מהירות, והוא מגיע לקצב תפוקה של פי 2,000 תחת עומס של 128 בקשות במקביל. הוא מתמודד עם דיבור חי, שירה, מוזיקת רקע והקלטות ארוכות בלי צורך לחלק אותן ידנית.

המודל מזהה לבד 30 שפות שונות, בהן אנגלית, ערבית, צרפתית ורוסית, לצד מבטאים מרובים ו־22 ניבים של סינית. עברית לא מופיעה ברשימת השפות הנתמכות שלו, כך שאם התוכן שלכם מקומי וישראלי לחלוטין, אין לכם מה לחפש כאן.

מתאים ל

  • תמלול שיחות בזמן אמת

    תמיכה בהזרמה ישירה עם השהיה מינימלית מאפשרת לפתוח ערוצי שמע חיים באנגלית או ערבית ולתרגם אותם לטקסט מיידית.

  • תמלול מאסיבי בעלות נמוכה

    בזכות תפוקה של פי 2,000 בעומס של 128 בקשות, אפשר לטחון מאגרים של אלפי שעות הקלטה על שרת צנוע בודד.

  • זיהוי שפות בדיבור מעורב

    הוא מזהה אוטומטית 30 שפות שונות בלי שתצטרכו להגדיר לו מראש באיזו שפה הדובר פתח את השיחה.

איפה זה נופל

המגבלה הכי כואבת לקהל מקומי היא חוסר תמיכה מוחלט בעברית. בנוסף, המודל הזה אינו מייצר חותמות זמן בעצמו. כדי לקבל תזמון מילים או אותיות תצטרכו להוריד ולהריץ במקביל מודל ייעודי נפרד, וזה עובד רק ב־11 שפות ולמשך של עד 5 דקות. במצב הזרמה חיה המערכת לא תומכת בריצה מקבילית ואינה מספקת חותמות זמן כלל. כמו כן, הוא נבנה לפשרת דיוק, ולכן הוא מפספס יותר בהשוואה לגרסת ה־1.7B.

אותה משפחה

Qwen3-ASR יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בתמלול בעברית?

לא. המודל תומך ב־30 שפות שונות כמו אנגלית, ערבית, צרפתית, רוסית וספרדית, לצד עשרות ניבים סיניים, אך עברית אינה ברשימה. אם קהל היעד שלכם מדבר עברית, המודל הזה לא יתאים למשימה שלכם.

איך אפשר להוציא ממנו חותמות זמן לפי מילים?

הוא לא מוציא חותמות זמן באופן טבעי. כדי לקבל תזמון, עליכם להריץ מודל משלים בשם Qwen3-ForcedAligner-0.6B שמצליב את הטקסט מול האודיו, וגם אז הוא מוגבל ל־11 שפות בלבד ועד 5 דקות הקלטה.

איך מריצים

אתם יכולים לטעון אותו ישירות דרך הספרייה הייעודית qwen-asr עם תשתית transformers, אבל בשביל לנצל את המהירות שלו באמת עדיף להתקין את תוסף ה־vLLM. התשתית הזו תומכת בתקשורת מוזרמת, שרת מובנה שתואם לפורמט של OpenAI, ועיבוד במנות. המודל שוקל פחות משני גיגה, מה שאומר שהוא ירוץ בלי בעיה גם על כרטיס מסך בסיסי עם 6 או 8 גיגה זיכרון.

מי שאין לו כרטיס מסך של אנבידיה שתומך ב־FlashAttention 2 יסבול מביצועים נמוכים בהרבה, ובמקרה כזה עדיף לשקול פנייה ישירה ל־API של DashScope במקום להסתבך עם תחזוקת שרת עצמאי.

pip install -U huggingface_hub
hf download Qwen/Qwen3-ASR-0.6B

הרישיון

הקוד והמשקלים שוחררו תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי מלא, שינוי קוד והפצה של המערכת כחלק ממוצר שלכם, כל עוד אתם שומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗