GPT
O

orpheus-3b-0.1-ft-Q4_K_M-GGUF

קוד פתוח

isaiahbjorkapache-2.02025-03-20

  • transformers
  • gguf
  • llama-cpp
  • gguf-my-repo
  • text-to-speech

גרסה מכווצת של מודל דיבור של 3 מיליארד פרמטרים, שמייצרת קבצי אודיו ישירות על המחשב. מקבלים כאן שמונה קולות ותגיות רגש בלי תלות בענן.

  • 2.2 GBמשקל הקבצים
  • 10,811הורדות בחודש
  • 73לייקים

מה זה

מדובר במודל טקסט לדיבור שמבוסס על orpheus-3b-0.1-ft ועבר קוונטיזציה לפורמט GGUF ברמת Q4_K_M. במקום לשלוח טקסט לשרתים חיצוניים ולשלם על כל בקשה, מריצים אותו מקומית דרך LM Studio ומקבלים קובץ WAV מוכן. הוא כולל תמיכה מובנית בשמונה קולות שונים, ביניהם tara שמוגדר כברירת המחדל, לצד שמות כמו leo, dan, jess ואחרים.

מה שמייחד אותו מעבר להרצה המקומית זה היכולת לשלוט בטונציה בעזרת תגיות רגש מוגדרות מראש. אפשר לשתול בתוך הטקסט פקודות כמו צחוק, פיהוק, אנחה או שיעול, והמודל משלב את הצלילים האלה ישירות בהקראה בלי צורך בעריכה ידנית של האודיו אחר כך.

מתאים ל

  • קריינות מקומית באנגלית

    יצירת קבצי אודיו מטקסט באנגלית ישירות על המחשב, בלי לשלוח מידע לרשת ובלי עלויות שימוש פר בקשה.

  • דיאלוגים עם תגובות רגשיות

    הפקת קולות למשחקים או דמויות שדורשות תגובות אנושיות כמו פיהוק, צחוק או אנחה לפי תגיות מוגדרות.

  • בדיקות סאונד לפיתוח

    מעבר מהיר בין שמונה קולות שונים לצורך בדיקת תסריטים ופיתוח ממשקים קוליים מקומיים.

איפה זה נופל

המודל תומך כרגע באנגלית בלבד. אין לו תמיכה בעברית, כך שאם תנסו להזין לו טקסט מקומי תקבלו ג'יבריש או שגיאות, והוא לא מתאים בכלל לממשקים בעברית. מעבר לזה, תגיות הרגש מוגבלות לרשימה סגורה בלבד, כמו צחקוק או שיעול, ואין דרך להגדיר סגנונות דיבור מורכבים יותר שלא נתמכים מראש.

שאלות
נפוצות

האם המודל יודע להקריא בעברית?

לא. המודל הוגדר ואומן עבור השפה האנגלית בלבד. ניסיון להזין לו עברית לא יפיק תוצאה שמישה.

איך משלבים צחוק או אנחה בתוך הדיבור?

כותבים את התגית ישירות בתוך הטקסט שנשלח למודל, למשל תגית laugh או sigh. המודל מזהה את התחביר ומייצר את הצליל הרלוונטי ברצף ההקראה.

האם חייבים את LM Studio כדי להשתמש בו?

הקוד וההוראות נבנו סביב השרת המקומי של LM Studio שרץ בכתובת המקומית. קובץ ה־GGUF עצמו סטנדרטי, אבל תשתית ההרצה והסקריפטים בכרטיס המודל נשענים על הכלי הזה.

איך מריצים

המשקל הכולל יושב על 2.2 ג'יגה בייט בשלושה קבצים, מה שאומר שהוא ירוץ בלי בעיה גם על מחשבים אישיים עם כרטיס מסך בסיסי או מעבדי אפל סיליקון, בלי לחנוק את הזיכרון. מריצים אותו על ידי טעינת הקובץ לתוך LM Studio, הפעלת השרת המקומי בכתובת ברירת המחדל, והרצת סקריפט פייתון ששולח אליו את הטקסט והפרמטרים.

אם אתם צריכים רק להקריא כמה משפטים פעם ביום ולא רוצים להתקין סביבת פייתון ושרת מקומי, פתרון ענן פשוט יחסוך לכם את ההתעסקות. המודל הזה מיועד למי שרוצה שליטה מלאה על הפרטיות ועל זמני התגובה אצלו במכונה.

ollama run hf.co/isaiahbjork/orpheus-3b-0.1-ft-Q4_K_M-GGUF:Q4_K_M

הקבצים

3 קבצים במאגר, 2.2 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא Apache 2.0. מותר להשתמש בו לצרכים מסחריים ופרטיים, לשנות את הקוד ולהפיץ אותו כחלק ממוצר שלכם, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗