GPT
Q

Qwen3-Omni-AudioTransformer

קוד פתוח

Atottiapache-2.02025-10-04

  • safetensors
  • qwen3_omni_moe_audio_encoder

חילוץ ממוקד של רכיב האודיו מתוך מודל ענק, שמיועד למי שרוצה לעבד קול בלי לסחוב עשרות מיליארדי פרמטרים של טקסט.

  • 648Mפרמטרים
  • 1.2 GBמשקל הקבצים
  • 1,262הורדות בחודש
  • 37לייקים

מה זה

מדובר במשקלים של הקידוד הקולי שנלקחו ישירות מתוך Qwen3-Omni-30B-A3B-Instruct. במקום להוריד מודל של שלושים מיליארד פרמטרים, המפרסם גזר רק את הטרנספורמר שמטפל באודיו, שכולל 648 מיליון פרמטרים ו־32 שכבות בארכיטקטורת תערובת מומחים.

המודל הזה לא מדבר ולא עונה לשאלות בעצמו. התפקיד שלו הוא לקחת קלט קולי ולהפוך אותו לייצוג וקטורי שהמשך הרשת מסוגלת להבין, בדיוק כמו במודל המקורי אבל במשקל קובץ של 1.2 גיגה בייט בלבד. אין בעמוד שלו תוצאות בנצ'מרק עצמאיות, והוא נשען כולו על הדוח הטכני של Qwen3-Omni המקורי.

מתאים ל

  • בניית מודל מולטימודלי

    חיבור רכיב אודיו מוכח למודל שפה קטן אחר, כדי לקבל יכולת שמיעה בלי לאמן אנקודר מאפס.

  • חילוץ מאפייני שמע

    יצירת וקטורים מייצגים מקבצי קול לצורכי סיווג, זיהוי דיבור או מנועי חיפוש מבוססי שמע.

  • מחקר והשוואת ייצוגים

    בדיקת איכות הקידוד של ארכיטקטורת המומחים מול אנקודרים ותיקים כמו Whisper, בעלויות ריצה נמוכות.

איפה זה נופל

זה לא מוצר עובד אלא רק חצי מוח. הוא אינו מפיק טקסט ואינו עונה תשובות, אלא רק מקודד אודיו, כך שלבד הוא חסר תועלת לחלוטין בלי מודל שפה שמחובר לקצה שלו. מעבר לזה, הכרטיס דל מאוד ולא מפרט איך הוא מתמודד עם עברית, מבטאים או רעשי רקע, כך שאתם נכנסים כאן לבדיקות עיוורות של איכות הקידוד לפני שאפשר לחשוב על ייצור.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה ישירות כדי לתמלל הקלטות בעברית?

לא, הוא אינו מתמלל בעצמו. מדובר ברכיב שממיר גלי קול לייצוג מספרי פנימי, ואין לו ראש לפענוח טקסט. כדי לקבל תמלול תצטרכו לחבר אותו למפענח או להשתמש במודל שלם.

למה להוריד את המשקלים האלה ולא את המודל המלא של Qwen?

המודל המלא שוקל עשרות גיגה בייט ודורש חומרה כבדה ויקרה. כאן מקבלים רק את מנוע השמע ששוקל 1.2 גיגה בייט בלבד, למי שרוצה לשלב אותו במערכת מקומית מותאמת.

איך מריצים

המשקל הכולל יושב על 1.2 גיגה בייט בחמישה קבצים, כך שכל כרטיס מסך בסיסי עם 4 עד 6 גיגה זיכרון מריץ אותו בלי להזיע, ואפשר להחזיק אותו אפילו על זיכרון של מחשב נייד רגיל. ההתקנה דורשת גרסת פיתוח עדכנית של transformers ישירות מגיטהאב, בגלל הארכיטקטורה הייעודית.

אם כל מה שאתם צריכים זה שירות תמלול מוכן או צ'אט קולי מלא, עדיף לפנות ל־API של מודל שלם. את הרכיב הזה שווה להריץ לבד רק כשאתם בונים צינור עיבוד קול משלכם וצריכים רק את שכבת החילוץ הראשונית.

pip install -U huggingface_hub
hf download Atotti/Qwen3-Omni-AudioTransformer

הקבצים

5 קבצים במאגר, 1.2 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון המדווח הוא apache-2.0, שמתיר שימוש מסחרי, שינוי קוד והפצה בלי תמלוגים, כל עוד שומרים על הודעות זכויות היוצרים. המפרסם ציין שהרישיון כפוף לתנאים של מודל המקור, כך שיש לוודא שאין תנאים סותרים ברישיון הבסיס של Qwen.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗