GPT
L

Llama-3.1-8B-Omni

קוד פתוח

ICTNLPother2024-09-10

  • llama-omni
  • safetensors
  • omni_speech2s_llama
  • large language models
  • speech-language models

מודל שיחה קולי מקצה לקצה שמבוסס על Llama 3.1 ומחזיר שמע וטקסט בו זמנית. הוא מיועד למי שרוצה אינטראקציה קולית ישירה עם שיהוי נמוך שמגיע ל־226 מילישניות.

  • 9.1Bפרמטרים
  • 131,072טוקנים בהקשר
  • 17.0 GBמשקל הקבצים
  • 101הורדות בחודש

מה זה

מדובר בהרחבה של מודל השפה הפופולרי, שמחברת אליו רכיבי עיבוד קול כדי לקלוט דיבור ולהפיק דיבור ישירות. במקום להמתין לתמלול מלא של המשתמש, להריץ טקסט ואז לשלוח אותו למנוע הקראה נפרד, הוא מייצר את תגובת השמע והטקסט במקביל. השיהוי המדווח בכרטיס עומד על 226 מילישניות, מה שאומר תגובה כמעט מיידית בדיאלוג קולי חי.

הצוות שפיתח אותו אימן את המערכת בפחות משלושה ימים באמצעות ארבעה מעבדים גרפיים בלבד, על בסיס קוד של LLaVA ו־SLAM-LLM. ההבדל המרכזי מול שימוש ברכיבים נפרדים הוא החיבור ההדוק בין הטקסט לדיבור, שמבטל את צווארי הבקבוק הרגילים של שרשור כלים.

מתאים ל

  • מחקר אינטראקציה קולית

    פיתוח ובדיקה של ארכיטקטורות קוליות מקצה לקצה שמייצרות דיבור ישיר ללא שרשור כלים נפרדים.

  • סייעני דיבור באנגלית

    מערכות דיאלוג שדורשות זמני תגובה אפסיים ושיהוי נמוך מאוד במחקר פנים ארגוני.

  • ניסויי ממשק מבוססי מודל שפה

    בחינת יכולות של מודלי שפה בשיחה פתוחה שמתנהלת בדיבור חי במקום בהקלדה.

איפה זה נופל

התמיכה המדווחת היא באנגלית בלבד. עברית בכלל לא נמצאת בתמונה כאן. בנוסף, הדמו מגיע עם אזהרה מפורשת על חוסר יציבות בהשמעת אודיו בסטרימינג בממשק, ולכן ניגון אוטומטי מנוטרל שם כברירת מחדל. עוד נקודה קריטית היא שרשרת התלויות, אם רכיב ה־vocoder החיצוני של פייסבוק או ה־Whisper לא נטענים בדיוק לפי ההגדרות, שום דבר לא ידבר.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה למוצר מסחרי?

לא. הרישיון המוגדר הוא לשימוש אקדמי ומחקרי בלבד. כדי לשלב אותו במוצר שמייצר הכנסות צריך לפנות ישירות לכתובת המייל של החוקרים ולבקש רישיון מיוחד.

האם המודל עובד בעברית?

הכרטיס מציין תמיכה בשפה האנגלית בלבד. רכיבי הקלט והשמע הוגדרו עבור אנגלית, ולכן דיבור בעברית לא יעבוד בצורה תקינה.

האם מספיק להוריד רק את הקבצים מ־Hugging Face כדי שהוא ידבר?

לא, הורדת המשקלים של המודל לא מספיקה לבדה. חובה להוריד בנפרד את מודל Whisper-large-v3 לצורך קליטת השמע ואת משקלי HiFi-GAN כדי לייצר את גלי הקול בחזרה.

איך מריצים

כדי להריץ אותו מקומית צריך מאיץ גרפי חזק. המודל שוקל 17 ג'יגה בייט בפורמט float16, ובנוסף אליו צריך לטעון את Whisper-large-v3 כרכיב קלט קולי ואת HiFi-GAN כמחולל שמע. זה אומר שבפועל תצטרכו כרטיס עם 24 ג'יגה בייט זיכרון גרפי לפחות, כמו RTX 3090 או A10G, רק כדי להעלות את כל החלקים יחד.

ההתקנה דורשת סביבת עבודה מסורבלת יחסית עם פייתון 3.10, גרסה ספציפית של pip, התקנה ידנית ממאגרי גיט של fairseq, וקימפול של flash-attention ללא בידוד תלויות. אם אתם מחפשים פתרון של פקודה אחת בדוקר או פנייה פשוטה לספק ענן מוכן, זה רחוק משם.

pip install -U huggingface_hub
hf download ICTNLP/Llama-3.1-8B-Omni

הרישיון

הקוד עצמו מופץ תחת Apache 2.0, אבל משקלי המודל חסומים לשימוש מחקרי ואקדמי בלבד. אסור לחלוטין להשתמש בו במוצר מסחרי, אלא אם פונים למייל של החוקרים ומבקשים רישיון ייעודי.

הרישיון המלא בעמוד המודל ↗