GPT
Q

Qwen3-ASR-1.7B-hf

קוד פתוח

Qwenapache-2.02026-06-26

  • transformers
  • safetensors
  • qwen3_asr
  • automatic-speech-recognition
  • zh

יש כאן גם סקירה על Qwen עצמו.

מודל תמלול פתוח בגודל שני מיליארד פרמטרים שמתחרה בביצועי שירותי ענן סגורים. הוא מתאים למי שרוצה הרצה עצמית של זיהוי דיבור עם הזרמה, חלון גדול ותמיכה בעשרות שפות.

  • 2Bפרמטרים
  • 65,536טוקנים בהקשר
  • 3.8 GBמשקל הקבצים
  • 255,324הורדות בחודש

מה זה

המודל מיועד לזיהוי דיבור ולזיהוי שפה ב־30 שפות ו־22 ניבים סיניים. מעבר לקול רגיל הוא מאומן להתמודד גם עם שירה ומוזיקת רקע, ומאפשר עבודה במצב לא מקוון או בהזרמה ישירה. הבסיס שלו מגיע מהיכולות הקוליות של Qwen3-Omni, והוא בנוי על ארכיטקטורת יצירה מותנית עם חלון הקשר של 65,536 טוקנים.

במבחני HuggingFace Open ASR Leaderboard המודל השיג שיעור שגיאות מילים ממוצע של 5.59, לעומת 6.31 בגרסת ה־0.6B הקטנה יותר. במבחנים נקיים כמו LibriSpeech Clean הוא יורד לרמה של 1.24 אחוזי שגיאה, וגם בהקלטות מורכבות של פגישות ושיחות פיננסיות כמו AMI ו־Earnings22 הוא שומר על פחות מעשרה אחוזי שגיאה. ההבדל המרכזי מול מתחרים בקטגוריה הוא היכולת להזריק מילים ייעודיות והקשר ישירות לפרומפט כדי לשפר דיוק של שמות ומונחים טכניים.

מתאים ל

  • תמלול פגישות באנגלית

    הזרקת שמות משתתפים ומונחים לפרומפט משפרת זיהוי שיחה עסקית.

  • זיהוי שפה בכניסות קוליות

    ניתוב אוטומטי של קבצי שמע בין עשרות שפות וניבים שונים.

  • תמלול קטעי שירה והופעות

    אימון ייעודי להתמודדות עם רעשי רקע ושירים בלי לאבד מילים.

איפה זה נופל

החיסרון המרכזי לקורא הישראלי ברור מיד. עברית אינה מופיעה ברשימת 30 השפות הנתמכות, ולכן המודל לא מתאים לתמלול שיחות בעברית. בנוסף, מי שצריך זמני מילים מדויקים לא מקבל אותם מהמודל הזה ישירות. חילוץ חותמות זמן דורש שרשור של מודל נפרד, Qwen3-ForcedAligner-0.6B, מה שמסבך את תהליך העבודה בקוד. שיעור השגיאות גם עולה באזורים רועשים במיוחד, כפי שרואים בתוצאות של מבחני פגישות ושיחות שטח.

אותה משפחה

Qwen3-ASR יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בתמלול קבצים בעברית?

לא. רשימת השפות הנתמכות כוללת ערבית, אנגלית, סינית ושפות אירופיות נוספות, אך עברית אינה נתמכת כלל. אם המוצר דורש עברית, המודל הזה לא יעזור לכם.

איך מחלצים חותמות זמן ברמת המילה?

המודל עצמו מייצר רק את הטקסט. כדי להפיק חותמות זמן יש להריץ לאחר מכן את מודל היישור Qwen3-ForcedAligner-0.6B על בסיס הטקסט שהתקבל, תהליך שתומך ב־11 שפות בלבד.

איך מריצים

המשקל הכולל של הקבצים עומד על 3.8 גיגה בייט. להרצה נוחה צריך כרטיס מסך בודד עם 8 עד 12 גיגה בייט של זיכרון תצוגה. המודל נתמך ישירות בספריית transformers החל מגרסה 5.13.0, וניתן להאיץ אותו באמצעות הפקודה torch.compile שהציגה שיפור של פי 2.4 בזמן היצירה על גבי מעבד A100 באצווה של 4.

אם רוצים לחסוך זיכרון ולתעדף תפוקה גולמית בשרת עמוס, גרסת ה־0.6B עשויה להספיק ומגיעה למהירות גבוהה יותר. שווה להקים תשתית עצמאית כשיש נפח שמע שוטף, רגישות לפרטיות או צורך בהזרמה מקומית. אם מדובר בכמה שעות שמע בחודש ללא דרישות אבטחה מיוחדות, ניהול שרת ייעודי כנראה לא יצדיק את העלות התפעולית לעומת ספק חיצוני.

from transformers import pipeline

pipe = pipeline("automatic-speech-recognition", model="Qwen/Qwen3-ASR-1.7B-hf")
print(pipe("שלום"))

הרישיון

הפרויקט מופץ תחת רישיון apache-2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו בתוך מוצרים פנימיים או שירותים חיצוניים. התנאים העיקריים דורשים שמירה על הודעת זכויות היוצרים המקורית וצירוף עותק של הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗