GPT
M

mini-omni2

קוד פתוח

gpt-omnimit2024-10-15

  • mini-omni2
  • any-to-any

הוא מדבר ומקשיב בקול ישירות, בלי מנועי תמלול והקראה חיצוניים, ומבין גם תמונות. פתרון קומפקטי למי שרוצה שיחה קולית רציפה ומשולבת ראייה מקומית.

  • 3.4 GBמשקל הקבצים
  • 96הורדות בחודש
  • 289לייקים

מה זה

מדובר במודל שמקבל תמונות, שמע וטקסט ומחזיר תגובה קולית ישירה בזמן אמת, לפי מנגנון פלט מקבילי מושהה שמונחה על ידי טקסט. בשונה מרוב המערכות שמרכיבות מודל שמיעה נפרד, מודל שפה באמצע ומודל דיבור בסוף, כאן התהליך קורה מקצה לקצה. השילוב הזה חוסך זמני המתנה בשיחה ומאפשר למודל להגיב ישירות למה שהוא רואה ושומע.

הבסיס נשען על מודל השפה Qwen2, יחד עם Whisper לקידוד האודיו, CLIP לראייה, ו־snac לפענוח הקול החוצה. האימון נעשה בשלושה שלבים של התאמת מקודדים, יישור מודאלי וכוונון עדין רב-מודאלי עם נתונים ממאגרים כמו OpenOrca ו־MOSS. משקל הקבצים עומד על 3.4 גיגה-בייט בלבד, מה שהופך אותו לניסוי מעניין מאוד ביחס ליכולות שלו.

מתאים ל

  • עוזר קולי עם ראייה

    שיחה קולית ישירה באנגלית על תמונות שהמשתמש מעלה בזמן אמת, בלי להמתין למודלי תמלול נפרדים.

  • מחקר אינטראקציה מקצה לקצה

    בדיקת ארכיטקטורות של דיבור ישיר לדיבור וקלט רב-מודאלי על גבי מודל קומפקטי שמבוסס על Qwen2.

  • הדגמות מקומיות של דיבור

    הרצה מקומית של שרת שיחה מבוסס קול ותמונה ללא תלות בחיבור רשת או בתשלום לפי קריאות.

איפה זה נופל

המודל אומן לפלוט דיבור אך ורק באנגלית. למרות שמקודד השמע של וויספר מסוגל להבין שפות זרות בקלט, התגובה הקולית תמיד תהיה באנגלית בלבד, כך שלשיחה בעברית הוא לא יעזור כרגע. בנוסף, מנגנון קטיעת הדיבור של המודל באמצע משפט מסומן עדיין כמשימה פתוחה בפיתוח, מה שאומר שהאינטראקציה לא תהיה חלקה לגמרי בשיחה מתפרצת.

שאלות
נפוצות

האם המודל תומך בדיבור או קלט בעברית?

המודל אומן לייצר פלט באנגלית בלבד. מקודד האודיו מבוסס על וויספר ולכן עשוי לפענח קלט בשפות נוספות, אבל התשובה תוחזר תמיד בקול באנגלית.

למה הדמו של סטרים-ליט לא מתחבר לשרת מרוחק?

הממשק חייב לרוץ מקומית על המחשב שבו מחובר המיקרופון עם PyAudio מותקן, כאשר משתנה הכתובת מצביע אל השרת שמבצע את העיבוד.

איך מריצים

כדי להריץ אותו צריך לשכפל את המאגר של המיזם, להתקין תלויות פייתון ולהרים שרת מקומי שמריץ את קובץ השרת עם ffmpeg מותקן במערכת. הממשק הגרפי מבוסס על סטרים-ליט ודורש הרצה מקומית עם ספריית PyAudio כדי לקלוט ולהשמיע קול ישירות מהחומרה שלכם.

במשקל של 3.4 גיגה-בייט הקבצים יכולים לשבת בקלות על כרטיס מסך מודרני בודד בעל זיכרון צנוע יחסית. עם זאת, ההקמה דורשת התעסקות בספריות שמע וחומרה מקומית, ואם אתם רק צריכים זיהוי תמונה פשוט או תמלול נקודתי בלי דיאלוג חי, עדיף להשתמש בשרותי ענן קיימים.

pip install -U huggingface_hub
hf download gpt-omni/mini-omni2

הרישיון

הפרויקט מופץ תחת רישיון MIT. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי הקוד והפצה חופשית, בתנאי ששומרים על הודעת זכויות היוצרים המקורית בתוך המוצר שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗