GPT
S

SoulX-Podcast-1.7B

קוד פתוח

Soul-AILabapache-2.02025-10-27

  • onnx
  • safetensors
  • qwen3
  • text-to-speech
  • en

מודל דיבור שמייצר שיחות ארוכות ומרובות דוברים בסגנון פודקאסט. הוא מתאים למי שרוצה צליל שיחה טבעי באנגלית או סינית עם צחוק ואנחות ולא הקראה מונוטונית.

  • 2.1Bפרמטרים
  • 40,960טוקנים בהקשר
  • 5.4 GBמשקל הקבצים
  • 519הורדות בחודש

מה זה

המודל מתמקד ביצירת דיבור דיאלוגי מרובה משתתפים לפורמטים ארוכים, לצד תמיכה בהקראה רגילה של דובר יחיד. הוא בנוי על ארכיטקטורת שפה עם עשרים ושמונה שכבות וחלון הקשר גדול במיוחד של 40,960 טוקנים, מה שמאפשר לו לשמור על רצף הגיוני בשיחות ממושכות בלי לאבד את ההקשר של הדוברים הקודמים.

הייחוד שלו מול מודלי דיבור מקבילים הוא היכולת לשלוט במאפיינים פאראלינגוויסטיים כמו שילוב של צחוק או אנחות בתוך הטקסט, לצד שיבוט קולות ללא אימון מוקדם. המודל שולט באנגלית, מנדרינית ובכמה ניבים סיניים כמו סצ'ואנזית וקנטונזית, כולל שכפול קול חוצה דיאלקטים.

מתאים ל

  • הפקת פודקאסטים סינתטיים

    יצירת שיחה שלמה ומרובת דוברים מטקסט באנגלית עם תגובות טבעיות וצחוק.

  • שיבוט קול בניבים סיניים

    שכפול קול ללא אימון מוקדם עבור תוכן שמע בקנטונזית או מנדרינית.

  • הקראת דיאלוגים ארוכים

    המרת תסריטים מורכבים לדיבור תוך שמירה על הקשר הדוק בעזרת חלון טוקנים רחב.

איפה זה נופל

החיסרון המרכזי למשתמש בארץ הוא היעדר מוחלט של תמיכה בעברית, המודל מיועד אך ורק לאנגלית, מנדרינית ומספר ניבים סיניים. בנוסף, חוסר היכולת הנוכחי להזרים אודיו תוך כדי יצירה מונע שילוב שלו במערכות קוליות אינטראקטיביות שדורשות השהיה מינימלית. המפתחים גם מציינים במפורש איסור על שימוש לצורך התחזות והונאות בקולות משובטים.

שאלות
נפוצות

האם המודל תומך בהקראת טקסטים בעברית?

לא. המודל אומן ותומך רק באנגלית, מנדרינית ומספר דיאלקטים סיניים כמו סצ'ואנזית וקנטונזית. ניסיון להזין טקסט בעברית לא יפיק דיבור תקין.

האם אפשר להשתמש בו לעוזר קולי בזמן אמת?

כרגע לא מומלץ. תמיכה בהזרמת אודיו נמצאת עדיין בפיתוח, כך שיש להמתין ליצירת הקובץ כולו לפני תחילת ההשמעה.

איך מריצים

ההתקנה דורשת סביבת לינוקס עם פייתון 3.11 והתקנת תלויות דרך קובץ הדרישות של המאגר הרשמי. המשקלים תופסים כחמישה נקודה ארבעה גיגה בייט ומחולקים לעשרים ושמונה קבצים, אותם מורידים ישירות דרך כלי הפקודה של הגינג פייס או בסקריפט פייתון. קיימת גרסת בסיס וגרסה ייעודית לדיאלקטים, והרצת ההסקה מבוצעת דרך סקריפטים ייעודיים של באש שמסופקים בקוד.

מבחינת חומרה, מודל של כשני מיליארד פרמטרים בדיוק צף מלא דורש כרטיס גרפי ייעודי עם מספיק זיכרון וידאו לטעינת המשקלים וניהול חלון ההקשר, במיוחד בהפקת שיחות ארוכות. אם המטרה היא מענה מיידי למשתמשי קצה בזמן אמת, עדיף להמתין או לבחור שירות חיצוני, שכן תמיכה בהזרמת אודיו בזמן אמת עדיין נמצאת ברשימת המשימות הפתוחות של המפתחים.

pip install -U huggingface_hub
hf download Soul-AILab/SoulX-Podcast-1.7B

הרישיון

הפרויקט מופץ תחת רישיון אפאצ'י שתיים אפס מלא לקוד ולמשקלי המודל. מותר להשתמש בו לצרכים מחקריים ומסחריים, לשנות את הקוד ולהפיץ אותו, כל עוד שומרים על תנאי הרישיון המקוריים וכתב הוויתור על אחריות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗