GPT
Q

Qwen3-ForcedAligner-0.6B

קוד פתוח

Qwenapache-2.02026-01-28

  • safetensors
  • qwen3_asr
  • automatic-speech-recognition

יש כאן גם סקירה על Qwen עצמו.

הכלי מייצר חותמות זמן מדויקות לפי מילים או תווים עבור טקסט והקלטת קול קיימים. הוא מתאים למי שצריך תזמון מדויק לכתוביות בלי לתת למודל לתמלל בעצמו.

  • 918Mפרמטרים
  • 1.7 GBמשקל הקבצים
  • 592,064הורדות בחודש
  • 158לייקים

מה זה

זהו מודל ייעודי ליישור כפוי (forced alignment), שונה ממודלי תמלול רגילים. במקום להאזין לאודיו ולנחש מה נאמר בו, אתם מספקים לו את קובץ השמע ואת הטקסט המדויק, והוא מחזיר זמני התחלה וסיום עבור כל מילה או תו. הוא עובד בארכיטקטורה לא אוטורגרסיבית (NAR) ומיועד לקטעי דיבור באורך של עד חמש דקות.

היוצרים שלו מדווחים שדיוק זמני התחילה והסיום שלו עוקף מודלים מקצה לקצה בתחום. הוא נבנה כרכיב משלים למשפחת Qwen3-ASR, במיוחד במצבים שבהם מנוע התמלול עצמו מפיק טקסט נקי אבל חסר דיוק ברמת המילישניות, או כשמזרימים מידע וצריכים סנכרון חיצוני.

מתאים ל

  • ייצור כתוביות לסרטונים

    חיבור אודיו מתומלל באנגלית או ספרדית כדי לקבל זמני הופעה מדויקים לכל מילה בקובץ.

  • עריכת אודיו מבוססת טקסט

    חיתוך קטעי קול בדיוק גבוה לפי מילים ספציפיות על בסיס חותמות הזמן שהמודל מחזיר.

  • תוספת זמנים לתמלול קיים

    הרצה כשלב שני אחרי מודל תמלול שלא מספק חותמות זמן ברמת התו או המילה.

איפה זה נופל

החיסרון המרכזי כאן נוגע ישירות לשוק המקומי, עברית בכלל לא נתמכת. המודל מוגבל ל־11 שפות ספציפיות בלבד: סינית, אנגלית, קנטונזית, צרפתית, גרמנית, איטלקית, יפנית, קוריאנית, פורטוגזית, רוסית וספרדית. בנוסף, הוא מוגבל לקטעי קול באורך של עד חמש דקות, ואינו תומך בהזרמה רציפה בזמן אמת בניגוד למודלי התמלול המקבילים בסדרה.

שאלות
נפוצות

האם המודל יכול לתמלל עבורי קובץ שמע ללא טקסט?

לא. המודל דורש גם את האודיו וגם את התמליל המדויק כקלט. התפקיד היחיד שלו הוא לחשב מתי כל מילה נאמרה, ולא לפענח מה נאמר.

האם אפשר להשתמש בו לקבצים בעברית?

לא. רשימת השפות מוגבלת ל־11 שפות בלבד, ביניהן אנגלית, צרפתית, רוסית וספרדית, ועברית אינה נכללת בהן.

איך מחברים אותו לפלטפורמת vLLM?

ב־vLLM אפשר לשלב אותו בשרת ASR כדי להוסיף חותמות זמן לפלט, ומומלץ להתקין FlashAttention להאצת העיבוד של מודל היישור.

איך מריצים

טוענים את המשקלים דרך חבילת qwen-asr בפורמט bfloat16 על גבי כרטיס מסך יחיד שתומך ב־CUDA. בנפח של פחות מ־2GB ועם FlashAttention 2, מדובר בכלי קל מאוד שלא דורש חומרת שרתים כבדה וירוץ בלי בעיה גם על כרטיס ביתי פשוט. המודל תומך בהזנת קבצים מקומיים, כתובות רשת, נתוני base64 ומערכי numpy.

מי שלא רוצה להרים סביבת פייתון מקומית יכול להשתמש בקונטיינר הדוקר הרשמי או לפנות ל־DashScope API של עליבאבא. אם הריצה היא עבור כמה קבצים בודדים ביום, פנייה ל־API חוסכת את ההתעסקות עם דרייברים והתקנות סביבה.

pip install -U huggingface_hub
hf download Qwen/Qwen3-ForcedAligner-0.6B

הרישיון

הפרויקט מופץ תחת רישיון apache-2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו כחלק ממוצר, כל עוד שומרים על הודעות זכויות היוצרים והרישיון המקוריות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗