GPT
R

Raon-SpeechChat-9B

קוד פתוח

KRAFTONcc-by-nc-4.02026-04-01

  • transformers
  • safetensors
  • raon_duplex
  • feature-extraction
  • speech

מודל קול לקול מלא שמסוגל להקשיב ולדבר בו זמנית באנגלית בזמן אמת. הוא מיועד למי שרוצה שיחה קולית טבעית שכוללת קטיעות ותגובות רקע בלי שרשרת כלים מפוצלת.

  • 9.7Bפרמטרים
  • 18.1 GBמשקל הקבצים
  • 1,586הורדות בחודש
  • 46לייקים

מה זה

מדובר במודל שיחה קולי מקצה לקצה שמבוסס על שילוב של Qwen3, מקודד השמע Voxtral-Mini-4B, קודק Mimi ומקודד דובר מבוסס ECAPA-TDNN. בשונה ממערכות קוליות רגילות שמחברות תמלול, מודל שפה וטקסט לדיבור בתהליך מדורג, כאן העיבוד נעשה כיחידה אחת בתצורת דופלקס מלא. המבנה הזה נותן לו להאזין ברצף גם כשהוא מדבר בעצמו.

הוא תומך בניהול תורות דיבור, התמודדות עם התפרצות של המשתמש לדבריו ויצירת קולות רקע קצרים כמו המהום בזמן שהצד השני מדבר, כולל אפשרות לשלוט בתדירות שלהם. בנוסף יש לו תמיכה ב־17 דמויות מוגדרות מראש והתאמת קול לפי דגימת אודיו קצרה.

מתאים ל

  • בוט שיחה קולי באנגלית

    מאפשר שיחה קולית זורמת עם זיהוי קטיעות ותגובות קצרות בזמן אמת בלי לעבור דרך טקסט.

  • מחקר אינטראקציית קול

    מתאים לבחינת מנגנוני דופלקס, חלוקת תורות דיבור והתאמת קולות דובר בסביבה מקומית.

  • עוזר קולי למשחקים

    משתמש ב־17 הדמויות המוכנות כדי ליצור אינטראקציות דיבור בעלות אופי ייחודי באנגלית.

איפה זה נופל

הכרטיס מציין תמיכה בשיחה באנגלית בלבד, כך שעבור עברית או שפות אחרות הוא לא רלוונטי כרגע. מעבר לזה, מודלים שמשלבים כמה רכיבים כמו מקודדי קול ומנבאי קודים דורשים תיאום מדויק בהרצה, והקוד נשען על הרצת קוד מרוחק בעלייה מהמאגר שמחייב זהירות בסביבות סגורות. הכרטיס אינו מציג טבלאות מדדים מספריות מדויקות אלא רק מציין ביצועים טובים בהתמודדות עם שתיקות, קטיעות ורצף שיחה, ולכן נדרשת בדיקה ידנית מעמיקה של איכות השמע ומהירות התגובה לפני כל שילוב במערכת.

שאלות
נפוצות

האם המודל תומך בשיחה בעברית?

לא. המודל הוגדר ואומן לשיחה באנגלית בלבד, ואין בכרטיס תיעוד לתמיכה בשפות נוספות.

האם אפשר להשתמש בו במוצר מסחרי?

לא, הרישיון הוא CC BY-NC 4.0 שמונע במפורש כל שימוש מסחרי. הוא מתאים רק למחקר, הדגמות ופיתוח פנימי שאינו מיועד למטרות רווח.

איזו חומרה מינימלית נדרשת להרצה מקומית?

הדמו הרשמי דורש כרטיס מסך של NVIDIA עם לפחות 16GB זיכרון VRAM ותמיכה ב־CUDA 12.x, לצד שטח אחסון של כ־25GB.

איך מריצים

כדי להריץ אותו מקומית צריך כרטיס של NVIDIA עם תמיכה ב־CUDA 12 לפחות וזיכרון וידאו של 16GB ומעלה. אפשר להעלות אותו ישירות דרך ספריית transformers הרגילה עם trust_remote_code או להרים סביבת בדיקה מלאה עם דפדפן באמצעות Docker Compose והריפו הייעודי של הפרויקט.

מבחינת משאבים, הורדת המשקולות דורשת סביב 18 עד 25 גיגה בייט פנויים בדיסק. אם אין לכם חומרה ייעודית עם כרטיס מתאים ורוחב פס נמוך מספיק לעיבוד אודיו בזמן אמת, הרצה מקומית על מחשב פיתוח רגיל תהיה איטית מדי לשיחה רציפה.

from transformers import pipeline

pipe = pipeline("audio-to-audio", model="KRAFTON/Raon-SpeechChat-9B")
print(pipe("שלום"))

הרישיון

הרישיון הוא CC BY-NC 4.0, מה שאומר שהוא מיועד למחקר, ניסויים ופרויקטים אישיים בלבד. שימוש מסחרי מכל סוג אסור, ואי אפשר לשלב אותו במוצר שמייצר הכנסה או מוצע ללקוחות בתשלום בלי להסדיר רישוי נפרד מול המפתחים.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗