GPT
Q

Qwen2-Audio-7B-GGUF

קוד פתוח

NexaAIapache-2.02024-10-23

  • gguf
  • audio-text-to-text
  • chat
  • audio
  • GGUF

מודל שמקבל קול וטקסט ומחזיר טקסט ישירות, בלי מודול תמלול נפרד בדרך. פתרון טוב למי שרוצה להריץ ניתוח אודיו ושיחה קולית מקומית על המחשב.

  • 81.5 GBמשקל הקבצים
  • 4,114הורדות בחודש
  • 172לייקים

מה זה

במקום לחבר מודל תמלול למודל שפה, מקבלים כאן מודל אחד שמבין אודיו באופן ישיר. הוא יודע לקחת קובץ קול או הקלטה חיה, לנתח רעשי רקע, לזהות דוברים, לתמלל, לתרגם ולענות ישירות לשאלות שנשאלות בקול, לצד ניתוח מוזיקה וצלילים.

הגרסה הזו ארוזה בפורמט GGUF על ידי NexaAI כדי לאפשר הרצה מקומית על מכשירי קצה. לפי המפתחים הוא עוקף את הגרסה הקודמת של Qwen-Audio במדדי הביצועים בכל המשימות, אבל ההבדל המעשי הוא היכולת להזין קול כקלט טבעי בלי לאבד את הניואנסים של הסאונד בדרך לטקסט.

מתאים ל

  • שיחה קולית מקומית

    מאפשר לענות לשאלות קוליות ישירות ללא צורך בהקמת צנרת מורכבת של זיהוי דיבור נפרד.

  • ניתוח רעשים וצלילים

    מזהה רעשי רקע, סביבה אקוסטית ומוזיקה, שימושי למיון קבצי אודיו לפי מאפיינים שאינם דיבור.

  • זיהוי דוברים ותרגום

    מזהה מי מדבר בהקלטה ומתרגם את הדברים לאנגלית משפות נתמכות ישירות מתוך הקול.

איפה זה נופל

המודל תומך באנגלית, סינית ובשפות אירופיות מרכזיות, ועברית בכלל לא מוזכרת בכרטיס. אם המטרה שלכם היא לעבד הקלטות בעברית, סביר מאוד שהוא ייכשל או יג'ברש לחלוטין. בנוסף, מודלים שמשלבים אודיו ישירות נוטים להיות רגישים להקלטות עם איכות נמוכה או מבטאים חריגים, כך שחובה לבדוק אותו על קבצי האודיו האמיתיים שלכם לפני שמתכננים עליו שירות.

שאלות
נפוצות

האם אפשר לתמלל איתו שיחות בעברית?

הכרטיס מציין תמיכה באנגלית, סינית ושפות אירופיות מרכזיות בלבד. שפות אחרות, כולל עברית, אינן נתמכות רשמית ולא מומלץ להסתמך עליו למשימות כאלה.

כמה זיכרון מחשב צריך בשביל להריץ אותו?

גרסת ברירת המחדל המכווצת (q4_K_M) דורשת 4.2GB של זיכרון RAM. מחשב פיתוח ממוצע יריץ אותה בקלות דרך ה־SDK של NexaAI.

האם המודל מוציא תשובה קולית בחזרה?

לא. סוג המשימה מוגדר כ־audio-text-to-text, כלומר הוא מקבל קול וטקסט ומחזיר תשובות בטקסט בלבד.

איך מריצים

כדי להריץ אותו משתמשים ב־Nexa-SDK. ההפעלה הבסיסית נעשית ישירות מהטרמינל בפקודת nexa run qwen2audio, שמושכת ומריצה ברירת מחדל של קוונטיזציית q4_K_M, או עם דגל st שמקפיץ ממשק מקומי בדפדפן. גוררים קובץ אודיו לחלון, מוסיפים הנחיה בטקסט אם רוצים, והוא מתחיל לעבוד.

גרסת ה־q4_K_M דורשת 4.2GB של זיכרון RAM בלבד, מה שאומר שאפשר להרים אותה על כמעט כל מחשב פיתוח מודרני בלי כרטיס מסך מפלצתי. אם אתם צריכים רק תמלול נקי של טקסט בלי לנתח את הסאונד עצמו, מודל תמלול רגיל או API חיצוני יעשו את זה בפחות משאבים ובלי שתצטרכו לנהל סביבת הרצה מקומית.

ollama run hf.co/NexaAI/Qwen2-Audio-7B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל מופץ תחת רישיון apache-2.0. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להפיץ אותו ולשלב אותו במוצרים סגורים בלי לשלם תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗