GPT
G

glm-4-voice-9b

קוד פתוח

zai-orgרישיון לא דווח2024-10-24

  • safetensors
  • chatglm
  • custom_code

מודל שיחה מקצה לקצה שמבין ומייצר קול ישירות, בלי תמלול ביניים. מתאים למי שרוצה לשלוט בטון, במהירות הדיבור וברגש בזמן אמת באנגלית או בסינית.

  • 9.5Bפרמטרים
  • 17.8 GBמשקל הקבצים
  • 7,318הורדות בחודש
  • 119לייקים

מה זה

מדובר במודל שפת דיבור שמבוסס על GLM-4-9B, ועבר אימון ייעודי כדי לעבד ולפלוט אודיו מקודד ישירות. במקום לעבוד בשרשרת הרגילה של זיהוי קול, עיבוד טקסט ומנוע דיבור נפרד, הוא מטפל בכל התהליך בתוך אותה רשת נוירונים. המטרה כאן היא לייצר דיאלוג שמרגיש טבעי יותר ומגיב בלי פערי הזמן שנוצרים ממעבר בין מערכות שונות.

הוא תומך באנגלית ובסינית בלבד, ויודע לשנות את אופן הדיבור לפי הוראות מפורשות. אפשר לבקש ממנו לדבר מהר יותר, לשנות נימת קול, להוסיף רגש או לעבור לדיאלקטים ספציפיים. הדף הנוכחי מכיל רק את חלק השפה והעיבוד של המודל, מתוך מערך מלא שמטפל בהמרה מקול וחזרה לצליל, כך שזה לא קובץ בודד שפותחים ומתחילים לשמוע.

מתאים ל

  • בוט קולי ישיר באנגלית

    מאפשר דיאלוג קולי שוטף בלי השהיות של תמלול נפרד ומנוע קול חיצוני.

  • שליטה ברגש ובמהירות

    מתאים למצבים שבהם צריך לשנות את טון הדיבור לפי פקודות טקסט ישירות.

  • מערכות דיאלוג בסינית

    אידיאלי לעבודה מול משתמשים דוברי סינית בזכות תמיכה בניבים שונים.

איפה זה נופל

הכרטיס מציין תמיכה באנגלית ובסינית בלבד. אין כאן שום תמיכה רשמית בעברית, ולא כדאי לבנות על יכולות דיבור או הבנה בשפות אחרות. מעבר לזה, המאגר הזה כולל רק את ליבת ה־LLM של הפרויקט, כך שהוא לא עובד כיחידה עצמאית שמקבלת מיקרופון ופולטת רמקול בלי התקנת יתר הרכיבים מהמאגר המקורי. לא דווחו נתוני ביצועים, זמני תגובה או צריכת זיכרון בעומס.

שאלות
נפוצות

האם המודל תומך בדיבור או בהבנה של עברית?

לא. המודל אומן והוגדר רשמית עבור אנגלית וסינית בלבד, ואין לו יכולת מובנית להבין או להשמיע עברית.

האם הורדת הקבצים האלה מספיקה כדי להתחיל לדבר איתו?

לא, המאגר מכיל רק את רכיב השפה מתוך הפרויקט השלם. כדי לעבוד איתו בקול צריך להתקין גם את שאר החלקים מהמאגר הראשי של GLM-4-Voice.

איך מריצים

כדי להריץ אותו בפורמט bfloat16 מלא צריך כרטיס עם לפחות 24 גיגה זיכרון וידאו, למשל RTX 3090 או A10G, כי הקבצים עצמם שוקלים 17.8 גיגה-בייט עוד לפני זיכרון עבודה לחישובים. מכיוון שמדובר רק בליבת הטקסט והאודיו המקודד, תצטרכו להביא גם את רכיבי המודל שממירים קול לטוקנים ובחזרה.

אם אין לכם כרטיס מקצועי פנוי או סביבה מוגדרת היטב לפריסת מודלים מרובי רכיבים, ההרמה המקומית עלולה להסתבך במהירות. במקרים כאלה עדיף לחפש נקודת קצה מנוהלת או שירות מבוסס ענן שמספק את המערך השלם.

pip install -U huggingface_hub
hf download zai-org/glm-4-voice-9b

הרישיון

היוצרים לא ציינו רישיון בעמוד המודל. מבחינה משפטית, היעדר רישיון אומר שאין לכם שום הרשאה מפורשת להשתמש בו, להפיץ אותו או לבנות עליו מוצר מסחרי. מי שמתכנן להכניס אותו לסביבת ייצור חייב לבדוק את הרישיון במאגר הראשי של הפרויקט לפני שכותבים שורת קוד אחת.

הרישיון המלא בעמוד המודל ↗