GPT
Q

Qwen3-Omni-30B-A3B-Captioner

קוד פתוח

Qwenother2025-09-15

  • transformers
  • safetensors
  • qwen3_omni_moe
  • text-to-audio
  • multimodal

יש כאן גם סקירה על Qwen עצמו.

מודל ייעודי שמקבל קובץ קול ומחזיר תיאור טקסטואלי מפורט של מה שקורה בו. הוא פונה למי שצריך ניתוח עמוק של צלילים, דיבור ורקע בלי לכתוב פרומפטים מורכבים.

  • 32Bפרמטרים
  • 59.1 GBמשקל הקבצים
  • 23,474הורדות בחודש
  • 243לייקים

מה זה

מדובר במודל שמבוסס על ארכיטקטורת MoE עם כמעט 32 מיליארד פרמטרים כוללים, שעבר כוונון ייעודי למשימה אחת בלבד, כתיבת תיאורים מילוליים לקטעי שמע. בניגוד למודלי שיחה כלליים או מודלי תמלול רגילים שרק ממירים דיבור לטקסט, המודל הזה מפרק את האודיו לגורמים. הוא מאתר רבדים שונים בהקלטה, החל מרגשות של דוברים שונים, כוונות ואינטונציות, ועד לצלילי רקע מורכבים, מוזיקה ואפקטים קוליים בסרטים.

ההבדל המרכזי מול מודלים אחרים במשקל הזה הוא המיקוד. לא שואלים אותו שאלות ולא מנחים אותו איך לענות, הוא פשוט מקבל אודיו ומייצר תיאור עשיר עם מעט מאוד הזיות, לפי הצהרת המפתחים. הוא לא כולל יכולות שיחה רב שלבית אלא פועל בריצה בודדת. המטרה כאן היא לספק ניתוח צליל רחב שאינו מוגבל רק לזיהוי מילים, אלא מבין את התמונה האקוסטית המלאה כולל הקשר תרבותי וסביבתי.

מתאים ל

  • תיוג ספריות סאונד

    הוא מזהה שכבות של אפקטים, מוזיקה ואווירה בקובצי קול ומייצר תיאור עשיר לחיפוש מהיר.

  • ניתוח שיחות שירות

    הוא קולט רגשות, כוונות וטונים של דוברים שונים בהקלטה ולא רק את המילים שנאמרות.

  • הנגשת וידאו ומדיה

    הוא מפיק כתוביות תיאוריות עבור כבדי שמיעה על ידי פירוט רעשי רקע ואווירה בסצנה.

איפה זה נופל

המודל מוגבל מאוד באופן ההפעלה שלו, הוא מקבל רק שמע ומוציא רק טקסט, בלי תמיכה בהנחיות טקסטואליות מצד המשתמש. אי אפשר לבקש ממנו להתמקד במשהו ספציפי או לשאול שאלות על הקובץ. מעבר לזה, הכרטיס מציין במפורש שהיכולת שלו לקלוט פרטים יורדת בקבצים ארוכים, וההמלצה הרשמית היא לא לעבור 30 שניות לאינפרנס. בנוסף, המודל מסומן לתמיכה בשפה האנגלית בלבד, כך שלא כדאי לבנות עליו לעיבוד תכנים בעברית.

שאלות
נפוצות

אפשר לתת למודל הוראות בטקסט יחד עם קובץ הקול?

לא. המודל בנוי לקבל קלט קולי בלבד ולהחזיר טקסט. אי אפשר לשלוח לו פרומפט שמבקש ממנו להתמקד בדובר מסוים או לענות על שאלה ספציפית.

האם הוא מתאים לתמלול פודקאסטים או הרצאות ארוכות?

לא, הוא לא מיועד לזה. היצרן ממליץ להגביל את הקבצים לעד 30 שניות, כי מעבר לזה יכולת ההבחנה שלו בפרטים נחלשת, והוא מתאר את הסצנה הקולית ולא מבצע תמלול רציף.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־59.1 גיגה בייט, כך שמדובר בריצה כבדה מאוד. להרצה בודדת ב־bfloat16 תצטרכו לפחות 64 עד 80 גיגה בייט של זיכרון גרפי, כלומר כרטיס מקצועי בודד כמו A100 או חלוקה בין כמה כרטיסים בעזרת vLLM, שבו היצרן מדגים פריסה על ארבעה מעבדים גרפיים עם חלוקת טנסורים.

ההתקנה דורשת כרגע בנייה מקוד מקור של vLLM מענף ספציפי או התקנת transformers ישירות מגיטהאב, לצד חבילת עזר ייעודית של Qwen וכלי ffmpeg במערכת. אם אין לכם שרת ייעודי פנוי עם כוח עיבוד כזה, עדיף להמתין לשירותי ענן מסודרים או להשתמש ב־API חיצוני, כי התחזוקה והעלות של שרת מקומי כזה למשימת ניתוח בלבד הן משמעותיות.

from transformers import pipeline

pipe = pipeline("any-to-any", model="Qwen/Qwen3-Omni-30B-A3B-Captioner")
print(pipe("שלום"))

הרישיון

הרישיון מוגדר כ־other ללא פירוט של תנאי שימוש חופשיים או מסחריים במסמך. המשמעות היא שאין אישור אוטומטי לשלב אותו במוצר מסחרי, וצריך לבדוק את תנאי השימוש המלאים במאגר של Qwen לפני שמשתמשים בו בסביבה עסקית.

הרישיון המלא בעמוד המודל ↗