GPT
Q

Qwen2-Audio-7B

קוד פתוח

Qwenapache-2.02024-07-16

  • transformers
  • safetensors
  • qwen2_audio
  • text2text-generation
  • chat

יש כאן גם סקירה על Qwen עצמו.

מודל שפה שמקבל שמע ישירות ומחזיר טקסט, בלי צורך במערכת תמלול נפרדת בדרך. הוא מתאים למי שרוצה לנתח קול או לבנות צ'אט קולי בלי לחבר כמה כלים יחד.

  • 8.4Bפרמטרים
  • 8,192טוקנים בהקשר
  • 15.7 GBמשקל הקבצים
  • 51,481הורדות בחודש

מה זה

המודל הזה קולט קבצי שמע ומפיק טקסט ישירות, כשהוא מציע שני מצבי עבודה שונים. במצב הראשון אתם שולחים לו פקודות קוליות והוא עונה בטקסט בלי קלט כתוב, ובמצב השני אתם מספקים קובץ קול לצד הנחיה כתובה ומבקשים ממנו לנתח את מה שנשמע שם.

בניגוד לשרשור רגיל שבו מודל אחד מתמלל ומודל שני עונה, כאן הרשת מעבדת את האות עצמו. זו גרסת הבסיס המאומנת מראש ולא גרסת השיחה המכווננת, כך שהיא מיועדת להמשך אימון, התאמה למשימות ספציפיות, או הפעלה ישירה של השלמת טקסט על בסיס קול.

מתאים ל

  • אימון מודל קולי ייעודי

    כבסיס לכוונון עדין על דאטה פנימי, במיוחד אם רוצים להתאים אותו לזיהוי מושגים בתחום מסוים.

  • ניתוח הקלטות באנגלית

    קבלת קובץ קול והנחיה כתובה כדי לחלץ תובנות או לזהות אירועים ישירות מתוך האות.

  • תשובה ישירה להוראות קוליות

    האזנה לפקודה מדוברת באנגלית והחזרת תשובה טקסטואלית ישירה בלי מעבר דרך מודל תמלול נפרד.

איפה זה נופל

הנתונים מגדירים תמיכה באנגלית בלבד. אם תזרקו עליו הקלטות בעברית, אין שום הבטחה שהוא יבין את הנאמר או יידע להגיב בהיגיון, וסביר להניח שתקבלו ג'יבריש. בנוסף, מדובר במודל בסיס ולא במודל שעבר התאמה לשיחה, מה שאומר שהוא עלול להמשיך את הקלט בצורה עיוורת במקום לענות לשאלות, אלא אם תכוונו אותו במדויק או תאמנו אותו על הנתונים שלכם.

אותה משפחה

Qwen2-Audio יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל הזה מתאים לעבודה עם שיחות בעברית?

הכרטיס מציין אנגלית בלבד כשפת המודל. הוא לא אומן או נבדק על עברית, ולכן אי אפשר להסתמך עליו לפרויקטים מקומיים בלי לאמן אותו מחדש.

מה ההבדל בינו לבין גרסת האינסטראקט?

זהו מודל בסיס שנועד בעיקר למפתחים שרוצים לבצע אימון נוסף או השלמות פשוטות. למי שמחפש מודל שמבין שאלות ומנהל שיחה קולית באופן טבעי, גרסת האינסטראקט תתאים בהרבה.

איך מריצים

כדי להריץ אותו מקומית צריך לפחות עשרים גיגה של זיכרון כרטיס מסך, או כרטיס ייעודי כמו שלוש מאות ותשעים אם רוצים להישאר בדיוק מלא בלי כימות. המשקל שלו עומד על כמעט שישה עשר גיגהבייט, כך שצריך גם חיבור יציב ומקום פנוי בדיסק.

ההפעלה נעשית דרך ספריית הטרנספורמרס, כשהמפתחים מציינים במפורש שצריך להתקין אותה ישירות מגיטהאב כדי למנוע שגיאות זיהוי של הארכיטקטורה. אם אתם צריכים רק צ'אט עובד מהקופסה, הגרסה הזו פחות מתאימה ועדיף לקחת את גרסת האינסטראקט, או לפנות למודל דרך שירות חיצוני אם אין לכם שרת מתאים.

from transformers import pipeline

pipe = pipeline("audio-text-to-text", model="Qwen/Qwen2-Audio-7B")
print(pipe("שלום"))

הרישיון

רישיון אפאצ'י שתיים מאפשר שימוש חופשי לגמרי, כולל שימוש מסחרי, שינוי של הקוד והמשקלים והפצה מחדש במוצרים סגורים. אתם לא חייבים לפתוח את הקוד שלכם, רק לשמור על הקרדיט והודעת הרישיון המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗