GPT
M

moshika-pytorch-bf16

קוד פתוח

kyutaicc-by-4.02024-09-17

  • moshi
  • safetensors
  • en

זהו מודל דיבור לדיבור שפועל בזמן אמת בלי להמתין לתורות שיחה מוגדרים. הוא מתאים למי שרוצה לבנות סוכן קולי ישיר עם זמני תגובה של כמאתיים מילישניות.

  • 7.7Bפרמטרים
  • 14.7 GBמשקל הקבצים
  • 5,429הורדות בחודש
  • 64לייקים

מה זה

הארכיטקטורה כאן מחברת מודל שפה טקסטואלי ישירות אל מקודד אודיו עצבי בשם מימי. במקום לתמלל את המשתמש, להעביר את הטקסט למודל שפה נפרד ואז לייצר דיבור מחדש, המערכת הזו מייצרת טוקנים של אודיו ישירות. היא מנהלת במקביל שני ערוצי קול, אחד של המשתמש ואחד שלה, וכך מסוגלת להקשיב ולדבר בו זמנית בלי לעצור באופן מלאכותי בכל פעם שצד אחד מסיים משפט.

המודל כולל שלב מקדים של מונולוג פנימי שבו הוא חוזה טוקנים של טקסט רגע לפני פליטת האודיו, מה שמשפר את הדיוק הלשוני שלו. זמן השיהוי התיאורטי עומד על 160 מילישניות, ובפועל מגיע לכמאתיים מילישניות. התוצאה היא שיחה שנשמעת שוטפת בהרבה בהשוואה לשרשור כלים נפרדים, אם כי יכולות ההסקה שלו מוגבלות יחסית למודלי שפה ענקיים.

מתאים ל

  • עוזר קולי לשיחה קלה

    מתאים לשיחות חולין, שאלות טריוויה פשוטות או מתכונים, בזכות זמני תגובה נמוכים מאוד.

  • משחקי תפקידים קוליים

    מאפשר אינטראקציה מדוברת רציפה שאינה דורשת מהמשתמש לחכות להחלפת תורות קשיחה.

  • מחקר של מודלי דיבור

    משמש בסיס פתוח לבדיקת ארכיטקטורות של דיבור ישיר ללא שלבי תמלום נפרדים.

איפה זה נופל

המודל פועל באנגלית בלבד, ואין לו שום תמיכה בעברית. היכולות שלו מוגבלות למשימות פשוטות, שיחות חולין או משחקי תפקידים, והיוצרים מציינים במפורש שאינו מסוגל להתחבר לכלים חיצוניים או לבצע פעולות מורכבות. הוא גם לא מומלץ לייעוץ מקצועי.

בנוסף, הוא אומן להפיק קול יחיד בלבד כדי למנוע התחזות. מבחינת תוכן, ניתוח הרעילות שלו מציב אותו בטווח הממוצע של מודלי שפה קיימים, עם הטיות לנושאים מסוימים שהופיעו בנתוני האימון.

שאלות
נפוצות

האם אפשר להשתמש בו עבור שיחות בעברית?

לא. נתוני האימון מבוססים על אנגלית בלבד והמודל הוגדר לשפה זו. הוא לא יבין קלט בעברית ולא יידע לייצר פלט תואם.

האם המודל יכול לשלוף מידע ממסד נתונים או להפעיל פונקציות?

לא באופן מובנה. היוצרים מבהירים כי אין לו גישה לכלים חיצוניים ויכולותיו ממוקדות באינטראקציה טבעית ומהירה בלבד ולא בביצוע משימות מורכבות.

איך מריצים

כדי להריץ את גרסת הדיוק הזו נדרשת ספריית הקוד הייעודית של הפרויקט. המשקלים תופסים קרוב לחמישה עשר גיגהבייט בזיכרון, כך שדרוש כרטיס גרפי מודרני עם עשרים וארבעה גיגהבייט של זיכרון וידאו כדי לטעון אותו בבטחה יחד עם פעולות ההסקה וההזרמה של האודיו.

מי שאין לו חומרה ייעודית כזו בענן או במחשב המקומי יתקשה לקבל את זמני השיהוי הנמוכים שהמודל מבטיח. אם אתם רק בודקים את ההיתכנות של שיחה קולית ולא חייבים שליטה מוחלטת בכל רכיב ברשת, הרצה עצמאית תדרוש תחזוקה כבדה לעומת שירותים מנוהלים.

pip install -U huggingface_hub
hf download kyutai/moshika-pytorch-bf16

הקבצים

5 קבצים במאגר, 14.7 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא קריאייטיב קומונס ייחוס ארבע אפס. המשמעות פשוטה: מותר להשתמש בו לצרכים מסחריים, לשנות אותו ולהפיץ אותו, כל עוד נותנים קרדיט מתאים ליוצרים המקוריים ומציינים אם נעשו שינויים.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗