GPT
Q

Qwen2-Audio-7B-Instruct

קוד פתוח

Qwenapache-2.02024-07-31

  • transformers
  • safetensors
  • qwen2_audio
  • text2text-generation
  • chat

יש כאן גם סקירה על Qwen עצמו.

מודל ששומע קבצי קול ומחזיר טקסט ישירות, בלי שלב תמלול נפרד בדרך. הוא יודע לנהל שיחה קולית או לנתח הקלטות לפי הוראות כתובות.

  • 8.4Bפרמטרים
  • 8,192טוקנים בהקשר
  • 15.7 GBמשקל הקבצים
  • 338,230הורדות בחודש

מה זה

מדובר במודל שפה וקול של 8.4 מיליארד פרמטרים, שמקבל אודיו ופולט טקסט. בשונה מחיבור רגיל של מודל תמלול למודל שפה, הוא מעבד את האות הקולי ישירות. הוא מגיע בשני מצבי עבודה עיקריים: שיחה מבוססת קול בלבד, או ניתוח של קובץ קול יחד עם הוראת טקסט שאתם מספקים לו.

הוא מבוסס על סדרת Qwen2 ומיועד להגיב לפקודות שמשולבות בדיבור. התמיכה המדווחת שלו היא באנגלית בלבד. עם חלון הקשר של 8,192 טוקנים, יש לו מספיק מרחב כדי לקבל קטעי שמע משמעותיים יחד עם היסטוריית השיחה ולהחזיר תשובות מפורטות בפורמט צ'אט רגיל.

מתאים ל

  • עוזר קולי מבוסס שיחה

    מאפשר לענות ישירות לשאלות קוליות באנגלית בלי צורך במנוע תמלול נפרד.

  • ניתוח והבנת הקלטות

    קבלת קובץ קול יחד עם שאלת טקסט וקבלת מענה על תוכן ההקלטה.

  • תחקור שיחות טלפוניות

    חילוץ תובנות ופרטים מתוך קבצי שמע באנגלית לפי בקשות מוגדרות מראש.

איפה זה נופל

השפה היחידה שמדווחת בכרטיס היא אנגלית, כך שאל תבנו עליו לעבודה בעברית בלי בדיקה מוקדמת ויסודית של יכולות הזיהוי והפלט. בנוסף, חלון ההקשר מוגבל ל־8,192 טוקנים, מה שחוסם אפשרות לנתח קבצי אודיו ארוכים מאוד ברצף אחד. כדאי לבדוק טוב איך הוא מתמודד עם רעשי רקע לפני שמשלבים אותו במערכת פעילה.

אותה משפחה

Qwen2-Audio יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בעברית?

הכרטיס מצהיר על תמיכה באנגלית בלבד. לא מומלץ להסתמך עליו לפרויקטים בעברית בלי לבדוק קודם אם הוא בכלל מזהה את השפה.

למה מופיעה לי שגיאת KeyError בהרצה ראשונה?

הקוד של המודל דורש גרסה עדכנית של ספריית transformers שמותקנת ישירות ממאגר הגיטהאב שלהם. התקנה רגילה מחבילות עשויה לא לכלול עדיין את הארכיטקטורה הזו.

איך מריצים

הקבצים שוקלים 15.7 גיגהבייט, כך שכדי להריץ אותו כמו שצריך בזיכרון של כרטיס מסך, תצטרכו חומרה עם לפחות 16 עד 24 גיגהבייט VRAM. הוא רץ דרך ספריית transformers, אבל שימו לב שהיוצרים מציינים במפורש שצריך להתקין את הספרייה ישירות מקוד המקור בגיטהאב, אחרת תקבלו שגיאה שהארכיטקטורה לא מזוהה.

קיימת גרסת בסיס לאימון וגרסת ההוראות הזו שמתאימה ישירות לשיחה. אם אין לכם שרת עם כרטיס מסך מתאים וזמין ברציפות, עדיף להשתמש בנקודת קצה מנוהלת במקום להחזיק תשתית כבדה ויקרה בשביל קריאות בודדות.

from transformers import pipeline

pipe = pipeline("audio-text-to-text", model="Qwen/Qwen2-Audio-7B-Instruct")
print(pipe("שלום"))

הרישיון

המודל משוחרר ברישיון apache-2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי חופשי, שינוי של הקוד והמשקלים, והפצה מחדש בתוך מוצרים. הדרישה העיקרית היא שמירה על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗