GPT
L

Llama-OuteTTS-1.0-1B-GGUF

קוד פתוח

OuteAIcc-by-nc-sa-4.02025-04-06

  • outetts
  • gguf
  • text-to-speech
  • en
  • ar

מודל הקראת טקסט קומפקטי שנשען על Llama 3.2 1B ומגיע בגרסת GGUF. הוא מתאים למי שרוצה הרצה מקומית קלה ושכפול קול מקובץ של 10 שניות.

  • 13.5 GBמשקל הקבצים
  • 1,851הורדות בחודש
  • 116לייקים

מה זה

המודל מבצע המרת טקסט לדיבור ושכפול קול על בסיס מודל שפה של מיליארד פרמטרים. בשונה מפתרונות קודמים שדרשו עיבוד מקדים מורכב, הוא מקבל טקסט גולמי ומיישר מילים ישירות מתוך הפרומפט, כולל קריאה של מספרים ללא צורך בהמרה למילים כתובות. קידוד האודיו עבר לארכיטקטורת DAC של IBM המשתמשת בשני ספרי קוד, מה שמעלה את איכות הצליל אבל מכפיל את קצב הטוקנים הנדרש ל־150 טוקנים לשנייה של שמע.

הוא אומן על כ־60 אלף שעות שמע ומציע תמיכה נרחבת ברשימת שפות שכוללת אנגלית, ערבית, צרפתית, גרמנית, ספרדית ועוד, לצד ביצועים בינוניים בשפות נוספות כמו פרסית ופולנית. עברית אינה מופיעה ברשימת השפות הנתמכות, ולמרות שהארכיטקטורה מסוגלת להפיק פלט מסוים גם בשפות לא מאומנות, התוצאה לא תהיה מדויקת או אמינה.

מתאים ל

  • שכפול קול מהיר למחקר

    צריך רק 10 שניות שמע כדי לייצר פרופיל דיבור סביר בלי אימון מחדש.

  • הקראת טקסט מקומית ללא רשת

    רץ ישירות על מעבד מקומי בעזרת GGUF ובמשאבי זיכרון מינימליים.

  • הפקת שמע רב־לשונית בערבית

    תומך בערבית כשפת אימון מרכזית עם קלט ישיר של מספרים וטקסט.

איפה זה נופל

חלון ההקשר מוגבל ל־8,192 טוקנים, מה שמאפשר לייצר עד 42 שניות שמע בבת אחת. אם אתם משתמשים בדגימת קול באורך 10 שניות לשכפול, חלון היצירה מתקצר ל־32 שניות בלבד. איכות השמע תלויה כמעט לחלוטין בקובץ הייחוס, ובלי קול מוגדר מראש המודל מפיק קולות אקראיים באיכות נמוכה. בנוסף, ערבוב שפות באותו קטע טקסט גורם לשגיאות הגייה, וקידוד ה־DAC רגיש לעיוותים בקובץ המקור.

אותה משפחה

Llama-OuteTTS-1.0 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בהקראת עברית?

עברית אינה מופיעה ברשימת השפות שבהן המודל אומן. המפתחים מציינים שניתן לנסות שפות לא נתמכות אך התוצאות לרוב אינן מוצלחות. לפרויקט בעברית תצטרכו לחפש כלי אחר.

למה האודיו יוצא מקוטע או מעוות בריצה מקומית?

ברוב המקרים מדובר בהגדרת דגימה שגויה. המודל דורש הגבלת קנס החזרתיות לחלון של 64 טוקנים אחרונים בלבד וטמפרטורה סביב 0.4, והרצה ללא ספריית outetts דורשת הגדרה ידנית של הפרמטרים האלה.

איך מריצים

כדי להריץ את גרסת ה־GGUF צריך לעבוד עם ספריית outetts הייעודית או לממש דגימה מדויקת מאוד. הזיכרון הנדרש נמוך מאוד בזכות בסיס ה־1B, כך שמעבד רגיל או כרטיס גרפי ביתי פשוט יספיקו להרצה ללא שרתים ייעודיים. הקבצים בעמוד שוקלים 13.5 גיגה בייט במצטבר ומכילים מגוון קוונטיזציות לבחירה.

מי שמתכנן לעבוד דרך ממשק משלו במקום בספרייה הרשמית ייתקל בבעיה. חובה להגדיר קנס חזרתיות שחל רק על חלון של 64 הטוקנים האחרונים, אחרת הפלט נשבר לחלוטין. אם אין לכם רצון לתחזק את ההגדרות האלה או שהחומרה המקומית שלכם חלשה מדי לעיבוד 150 טוקנים בשנייה, שירותי ענן מסחריים יחסכו זמן.

ollama run hf.co/OuteAI/Llama-OuteTTS-1.0-1B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הפיתוח והאימון הנוסף מוגנים ברישיון cc-by-nc-sa-4.0, לצד תנאי הרישיון של Llama 3.2. המשמעות ברורה, אסור להשתמש במודל הזה למוצרים מסחריים או לרווח כספי. בנוסף, כל שינוי או תוצר נגזר מחייב הפצה תחת אותם תנאים מגבילים.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗