GPT
K

Kimi-Audio-7B-Instruct

קוד פתוח

moonshotaimit2025-04-25

  • kimi-audio
  • safetensors
  • audio
  • audio-language-model
  • speech-recognition

מודל פתוח מקצה לקצה שמבין אודיו ומייצר דיבור ישירות בלי שרשור כלים. הוא מתאים למי שרוצה שיחה קולית רציפה בלי להסתמך על שירותים סגורים.

  • 9.8Bפרמטרים
  • 8,192טוקנים בהקשר
  • 39.7 GBמשקל הקבצים
  • 13,425הורדות בחודש

מה זה

מדובר במודל שמחבר הבנת שמע ויצירת דיבור תחת ארכיטקטורה אחת עם 28 שכבות וחלון של 8,192 טוקנים. במקום לחבר מודל תמלול נפרד, מודל שפה ומודל הקראה, הוא מעבד קלט שמע היברידי ופולט טקסט וסאונד במקביל. הבסיס שלו אומן על מעל 13 מיליון שעות שמע מגוונות הכוללות דיבור, מוזיקה וצלילים.

הוא מתמודד עם תמלול, מענה קולי לשאלות, תיאור סביבה אקוסטית, זיהוי רגשות וסיווג רעשים. ההבדל המרכזי מול פתרונות אחרים הוא שימוש בדטוקנייזר מבוסס flow matching שמזרים אודיו בחלקים כדי לחתוך את זמני ההמתנה ביצירת הקול.

מתאים ל

  • עוזר קולי באנגלית

    שיחה קולית מקצה לקצה שמייצרת תשובות דיבור ישירות בעזרת הזרמת שמע מהירה.

  • תמלול וניתוח רגש

    זיהוי דיבור משולב עם פענוח תחושות ואירועי רקע באותו מעבר חישובי.

  • מענה קולי לשמע

    האזנה להקלטות ומתן תשובות טקסטואליות או קוליות על התוכן שנשמע בהן.

איפה זה נופל

השפות הנתמכות הן אנגלית וסינית בלבד, כך שעבור פרויקטים בעברית הוא לא מתאים כרגע. מעבר לכך, הכרטיס מציג כותרות כלליות על תוצאות מדידה בלי לפרט ציונים מדויקים בתוך הטקסט, ומדובר בארכיטקטורה ייעודית MoonshotKimiaForCausalLM שדורשת קוד ייעודי של ספריית kimi-audio ולא עובדת בהכרח ישר מהקופסה בספריות סטנדרטיות.

אותה משפחה

Kimi-Audio יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להשתמש בו לשיחות קוליות בעברית?

לא, המודל אומן ותומך רשמית רק באנגלית ובסינית. הוא לא מיועד להבנה או ליצירת דיבור בעברית.

האם המודל דורש חיבור למערכת הקראה נפרדת כדי לדבר?

לא, הוא כולל מנגנון יצירת שמע משלו שמפיק קול ישירות במקביל לטקסט, כולל הזרמה בחלקים לצמצום זמני השיהוי.

איך מריצים

כדי להריץ אותו תצטרכו להוריד 39.7 גיגה בייט של קבצים בפורמט bfloat16. המפתחים ממליצים להרים אותו בתוך קונטיינר של דוקר באמצעות התמונה הרשמית moonshotai/kimi-audio:v0.1 או לבנות לבד ממאגר הגיטהאב כדי למנוע בעיות תלויות.

במשקל כזה ועם 9.8 מיליארד פרמטרים, תצטרכו מאיץ גרפי ייעודי עם מספיק זיכרון וידאו להחזקת המשקולות והרצת מנגנון הזרימה. אם אין לכם חומרה כזו מקומית, עדיף לפנות לפתרון ענן שבו מריצים את הקונטיינר לפי דרישה במקום לנסות להריץ על מחשב פיתוח רגיל.

pip install -U huggingface_hub
hf download moonshotai/Kimi-Audio-7B-Instruct

הרישיון

הרישיון המדווח הוא MIT, שמאפשר שימוש חופשי כולל שימוש מסחרי ושינוי קוד. עם זאת, הכרטיס מציין שהמודל מתבסס על Qwen 2.5-7B, ולכן קוד שנגזר ממנו כפוף לרישיון Apache 2.0 בעוד שאר החלקים תחת MIT. בשני המקרים מדובר ברישיונות מתירניים שמאפשרים שילוב במוצרים, בתנאי ששומרים על הודעות זכויות היוצרים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗