GPT
Q

Qwen-Audio

קוד פתוח

Qwenרישיון לא דווח2023-11-30

  • transformers
  • safetensors
  • qwen
  • text-generation
  • audio-text-to-text

יש כאן גם סקירה על Qwen עצמו.

מודל שמקבל הקלטות קול, שירה או רעשי סביבה יחד עם טקסט, ומחזיר תשובות טקסטואליות ישירות. מתאים למי שרוצה ניתוח אודיו מגוון בלי שרשור של מודל תמלול נפרד למודל שפה.

  • 8.4Bפרמטרים
  • 2,048טוקנים בהקשר
  • 15.6 GBמשקל הקבצים
  • 986הורדות בחודש

מה זה

המודל הזה משלב עיבוד אודיו ישירות לתוך ארכיטקטורת שפה בנפח של 8.4 מיליארד פרמטרים. במקום להמיר קודם דיבור למילים ואז לעבד אותן, הוא מאומן על יותר מ־30 משימות שונות במקביל, כולל דיבור אנושי, זיהוי סביבות קוליות ומוזיקה. התוצאה היא יכולת להבין מה קורה בהקלטה ולא רק מה נאמר בה.

לפי הנתונים שפורסמו, הוא הגיע לתוצאות מובילות במבחנים כמו Aishell1 לתמלול, cochlscene לזיהוי סצנות אקוסטיות, ו־ClothoAQA למענה על שאלות מתוך שמע, וכל זה בלי צורך באימון ייעודי לכל משימה. ההבדל המרכזי מול מודלים רגילים בגודל הזה הוא התמיכה המובנית בקלט שמע ישיר ולא רק בטקסט.

מתאים ל

  • מענה על שאלות מתוך הקלטות

    מאפשר לשאול ישירות על תוכן של קובץ קול, בלי לתמלל אותו קודם.

  • זיהוי סביבה ואירועי קול

    מתאים לזיהוי רעשי רקע וסצנות אקוסטיות לצד דיבור רגיל.

  • תמלול משולב לסינית ואנגלית

    מציג ביצועים גבוהים במבחני שמע בשפות הנתמכות ישירות מהקובץ.

איפה זה נופל

חלון ההקשר מוגבל ל־2,048 טוקנים בלבד, שזה מעט מאוד כשמשלבים בתוכו גם קידוד של קובצי שמע וגם טקסט. המודל אומן רק על אנגלית וסינית, כך שאין כאן תמיכה בעברית, לא בדיבור ולא בטקסט. בנוסף, זו גרסת בסיס שלא עברה כיוונון לשיחה, כך שאם תנסו לנהל איתה דיאלוג חופשי בלי הנחיות מדויקות או שכבת התאמה, התשובות לא יהיו במבנה של צ'אט.

אותה משפחה

Qwen-Audio יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה לעיבוד הקלטות בעברית?

לא. המודל הוכשר ספציפית על אנגלית וסינית בלבד, והוא לא מיועד לזהות דיבור או להחזיר טקסט בעברית.

האם הוא מתאים לשיחה קולית רציפה כמו בוט?

לא בגרסה הזו. זהו מודל בסיס שפולט טקסט לפי קלט, ולא עבר כיוונון לשיחות, כשלמטרה זו יש את גרסת הצ'אט הנפרדת.

איך מריצים

המשקלים תופסים 15.6 גיגה-בייט בפורמט bfloat16, כך שתצטרכו כרטיס מסך עם לפחות 24 גיגה-בייט זיכרון כדי לטעון אותו ולהריץ הסקה בצורה סבירה. סביבת העבודה דורשת פייתון 3.8 ומעלה, פייטורץ' מגרסה 1.12, קישוריות ל־CUDA 11.4 ומעלה, וחשוב לוודא שמותקן אצלכם FFmpeg לטיפול בקובצי הקול.

הגרסה הזו היא מודל הבסיס שמיועד להשלמת טקסט ואימון המשך, בעוד לשיחות מרובות תורות קיים מודל נפרד שמותאם לצ'אט. אם אין לכם שרת ייעודי עם חומרה מתאימה, עדיף להשתמש בשירות מנוהל שחושף אותו, במיוחד כשמדובר בעיבוד קבצי אודיו כבדים שדורשים משאבים רציפים.

from transformers import pipeline

pipe = pipeline("text-generation", model="Qwen/Qwen-Audio")
print(pipe("שלום"))

הרישיון

בדף המודל הרשמי לא הוזן רישיון מוגדר, אך בתיאור הטקסטואלי נכתב שהשימוש פתוח לחוקרים ומפתחים כולל שימוש מסחרי. עם זאת, היעדר קובץ רישיון סטנדרטי וברור במאגר מחייב בדיקה של תנאי השימוש המלאים בגיטהאב שלהם לפני שמפיצים אותו כחלק ממוצר.

הרישיון המלא בעמוד המודל ↗