GPT
Q

Qwen3-ASR-1.7B

קוד פתוח

Qwenapache-2.02026-01-28

  • safetensors
  • qwen3_asr
  • automatic-speech-recognition
  • eval-results

יש כאן גם סקירה על Qwen עצמו.

תמלול דיבור רב לשוני וזיהוי שפה בקובץ של 4.4 גיגה בלבד. הוא מתחרה בשירותי ענן מסחריים ותומך בהזרמה בזמן אמת בלי לסבך את התשתית.

  • 2.3Bפרמטרים
  • 4.4 GBמשקל הקבצים
  • 3,161,832הורדות בחודש
  • 1,083לייקים

מה זה

המודל מתבסס על ארכיטקטורת Qwen3-Omni ומיועד לתמלול אודיו ולזיהוי שפה ב־30 שפות שונות, לצד 22 דיאלקטים סיניים ומגוון מבטאים באנגלית. מעבר לדיבור רגיל, הוא מאומן להתמודד עם שירה, רעשי רקע ומוזיקה שמלווה את הדיבור, תרחישים שבהם מודלים קלאסיים נשברים ומייצרים הזיות.

הוא מציע שתי צורות עבודה: תמלול קבצים מלא או פענוח בהזרמה ישירה מאודיו חי. לפי נתוני היצרן, גרסת ה־1.7B מגיעה לביצועים הטובים ביותר בקטגוריית הקוד הפתוח ועומדת ראש בראש מול ממשקים מסחריים סגורים. יש גם גרסה קטנה יותר של 0.6B שמתועדפת למהירות ומגיעה לרוחב פס של פי 2000 בעומס מקבילי, אבל הגרסה הזו מכוונת לדיוק מרבי.

מתאים ל

  • תמלול שיחות באנגלית וערבית

    מתאים למוקדי שירות מרובי שפות בזכות תמיכה מובנית בערבית ובמבטאים שונים באנגלית.

  • שרת תמלול פנימי בארגון

    משקל של 4.4 גיגה מאפשר להריץ אותו מקומית על כרטיס בודד ללא דליפת מידע החוצה.

  • תמלול בזמן אמת ב־vLLM

    תומך בהזרמת קול רציפה ישירות ממיקרופון עם ממשק תואם OpenAI.

איפה זה נופל

החיסרון המרכזי למשתמש הישראלי ברור לחלוטין: עברית פשוט לא קיימת ברשימת 30 השפות הנתמכות. בנוסף, חילוץ חותמות זמן מדויקות לפי מילים לא מובנה בתוכו, וכדי לקבל אותן צריך להריץ מודל נפרד בשם Qwen3-ForcedAligner-0.6B, שתומך רק ב־11 שפות ומוגבל לקטעים של עד חמש דקות. אם תבחרו להריץ תמלול בהזרמה חיה, תאבדו את היכולת לעבוד באצוות ולקבל חותמות זמן.

אותה משפחה

Qwen3-ASR יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל יודע לתמלל הקלטות בעברית?

לא. רשימת השפות הנתמכות כוללת 30 שפות וביניהן אנגלית, ערבית, רוסית, צרפתית וספרדית, אך עברית אינה נכללת בהן.

איך מקבלים חותמות זמן עבור כל מילה?

המודל עצמו לא מייצר חותמות זמן ישירות בתמלול הרגיל. כדי להוציא תזמונים ברמת מילה צריך להריץ לצידו מודל ייעודי בשם Qwen3-ForcedAligner-0.6B, שמוגבל להקלטות של עד חמש דקות וב־11 שפות בלבד.

מה צריך כדי להריץ אותו על שרת משלי?

כרטיס מסך בודד של אנבידיה עם 8 עד 12 גיגה זיכרון יספיק לטעינת המשקולות ב־bfloat16. מומלץ להתקין את החבילה qwen-asr יחד עם מנוע vLLM ו־FlashAttention 2 כדי לקבל ביצועים סבירים.

איך מריצים

בפועל מריצים אותו דרך חבילת הפייתון qwen-asr או ישירות דרך vLLM בתמיכת יום אפס. משקל הקבצים עומד על 4.4 גיגה ב־bfloat16, כך שכרטיס מסך בודד עם 8 עד 12 גיגה VRAM יספיק לשרת אותו, במיוחד אם מפעילים FlashAttention 2 לחסכון בזיכרון וזמני ריצה.

אם אתם צריכים תפוקה מהירה או הזרמה, vLLM היא חובה ומאפשרת לפתוח שרת שתואם לפרוטוקול של OpenAI. אם אין לכם חומרה ייעודית, עליבאבא מספקת גישה למודל דרך ממשק ה־API של DashScope, ושם משלמים לפי שימוש בלי להחזיק שרתים באוויר.

pip install -U huggingface_hub
hf download Qwen/Qwen3-ASR-1.7B

הרישיון

הקוד והמשקולות מופצים תחת רישיון apache-2.0. הרישיון מתיר שימוש מסחרי מלא, שינוי של הקוד והפצה פנימית או חיצונית, בתנאי ששומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗