GPT
O

OmniAudio-2.6B

קוד פתוח

NexaAIapache-2.02024-12-11

  • gguf
  • audio-text-to-text
  • chat
  • audio
  • GGUF

מודל קטן שמקבל הקלטות קול וטקסט ומחזיר טקסט ישירות על המכשיר. פתרון מתאים למי שחייב לעבד אודיו מקומית בלי תלות ברשת ורוצה תגובה מהירה מאוד.

  • 11.8 GBמשקל הקבצים
  • 538הורדות בחודש
  • 289לייקים

מה זה

מדובר בחיבור ישיר בין Gemma-2-2b לבין Whisper turbo עם שכבת תיאום ייעודית ביניהם. במקום להריץ מודל תמלול נפרד שמעביר את הפלט למודל שפה, הכל קורה ברשת אחת שמבינה קול וטקסט ומחזירה תשובה כתובה.

היתרון המרכזי כאן הוא ביצועים מול משאבים. לפי הבדיקות של המפתחים על מחשב Mac Mini M4 Pro, גרסת ה־GGUF המכווצת שלו מגיעה לקצב פענוח של 66 טוקנים לשנייה, וגם גרסת ה־FP16 מגיעה למעל 35 טוקנים לשנייה. בהשוואה למודלים כמו Qwen2-Audio-7B שזוחלים באזור ה־6 טוקנים לשנייה על אותה חומרה, מדובר בהבדל שמאפשר שיחה קולית שמרגישה טבעית ולא תקועה.

מתאים ל

  • תמלול וסיכום הקלטות מקומי

    מאפשר לעבד פתקי קול ופגישות ישירות על המכשיר ללא חיבור לאינטרנט ושמירה על פרטיות.

  • עוזר קולי במכשירי קצה

    צורך מעט מאוד זיכרון ומגיב מהר, מה שמתאים לחומרה פשוטה יחסית שצריכה לענות לשאלות.

  • עריכת טון להודעות מוקלטות

    הופך תזכיר קולי יומיומי לטקסט מנוסח ומקצועי בפעולה אחת ישירה ללא שרשור כלים.

איפה זה נופל

המודל אומן על אנגלית בלבד, עם נתוני MLS English, ופלט התגובה שלו הוא טקסט בלבד ולא קול חוזר. אם אתם מחפשים מענה קולי שלם לשני הצדדים, תצטרכו להדביק לו מנוע הקראה נפרד.

מעבר לזה, אימון השיחה והיישור נשענו על דאטה סינתטי ומשוב מ־GPT-4o, והבסיס הטקסטואלי הוא מודל קטן של 2 מיליארד פרמטרים. זה אומר שהבנת שאלות מורכבות תהיה מוגבלת, והמודל עשוי לטעות בקלות אם השיחה סוטה מהוראות פשוטות.

שאלות
נפוצות

האם המודל יודע לדבר בחזרה בקול?

לא. המודל מקבל קול וטקסט אך מחזיר טקסט כתוב בלבד. כדי להשמיע תשובה תצטרכו לחבר לו מודל הקראה חיצוני, אם כי המפתחים ציינו שהם עובדים על יכולת כזו בעתיד.

האם אפשר לדבר איתו בעברית?

לא מומלץ לבנות על זה. המודל מוגדר ומתועד עבור אנגלית בלבד, וכל נתוני האימון שהוצגו בכרטיס התבססו על מאגרים באנגלית.

איך מריצים

ההרצה המקומית מתבססת על התקנת Nexa-SDK דרך שורת הפקודה. גרסת ה־Q4_K_M דורשת רק 1.30 גיגה זיכרון עבודה ו־1.60 גיגה שטח אחסון, כך שאפשר להריץ אותה כמעט על כל לפטופ מודרני או מחשב קצה בלי צורך בכרטיס מסך מפלצתי.

הקבצים המלאים של המודל שוקלים 11.8 גיגה ב־9 קבצים, אבל אם אתם מכוונים להרצה פשוטה על מכשיר קצה, שימוש בגרסה המכווצת דרך ה־SDK שלהם יחסוך את רוב כאב הראש.

ollama run hf.co/NexaAI/OmniAudio-2.6B:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הפרויקט משוחרר תחת רישיון Apache 2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו בתוך מוצרים סגורים. התנאים העיקריים הם שמירה על הודעת הרישיון ומתן קרדיט ליוצרים המקוריים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗