GPT
U

ultravox-v0_4

קוד פתוח

fixie-aimit2024-08-23

  • transformers
  • safetensors
  • ultravox
  • feature-extraction
  • audio-text-to-text

מודל שפה שמקבל שמע וטקסט ישירות ופולט טקסט. הוא מחבר את וויספר ולאמה לחבילה אחת מהירה בלי שלב תמלול נפרד באמצע.

  • 8.1Bפרמטרים
  • 131,072טוקנים בהקשר
  • 15.1 GBמשקל הקבצים
  • 1,615הורדות בחודש

מה זה

במקום להריץ מודל תמלול ואז לשלוח את הטקסט למודל שפה, המודל הזה מאחד את התהליך. הוא מחבר את המקודד של Whisper-medium ישירות לתוך Llama3.1-8B-Instruct באמצעות מתאם ייעודי, כאשר שני המודלים המקוריים נשארו קפואים ורק החיבור ביניהם אומן.

התוצאה היא מענה קולי מהיר בהרבה, עם זמן של כ־150 מילי-שניות לטוקן הראשון וקצב של 50 עד 100 טוקנים לשנייה על חומרה מתאימה. במבחני הדיוק הוא מציג שגיאת זיהוי דיבור של 4.45 בבדיקת LibriSpeech, וציון תרגום משמעותית טוב יותר מגרסאות קודמות, קרוב מאוד לביצועים של לאמה על טקסט נקי.

מתאים ל

  • בוט שיחה קולי באנגלית

    מאפשר תגובה בזמן אמת של 150 מילי שניות לשאלות מדוברות ללא שרשור תמלול נפרד.

  • תרגום משמע לטקסט

    מתרגם ישירות דיבור בספרדית או גרמנית לטקסט כתוב באנגלית ברמת דיוק גבוהה.

  • ניתוח שיחות מוקלטות

    מנתח ישירות קובצי שמע מרובי שפות ומסכם אותם לטקסט תחת חלון הקשר ענק.

איפה זה נופל

המודל פולט טקסט בלבד ולא קול, כך שלסוכן קולי מלא עדיין תצטרכו מנוע הקראה נפרד. הוא לא עבר כוונון העדפות כמו RLHF, ולכן התשובות עשויות להיות גולמיות יותר. עברית לא נכללת ברשימת השפות הנתמכות שלו, שכוללת רק אנגלית, ערבית, גרמנית, ספרדית, צרפתית, איטלקית, יפנית ופורטוגזית, ולכן הוא לא מתאים לעיבוד שמע מקומי בישראל.

שאלות
נפוצות

האם המודל יודע להחזיר תשובה בקול?

לא, הוא מקבל שמע ופולט טקסט בלבד. המפתחים ציינו כי תמיכה בהפקת טוקנים קוליים מתוכננת לגרסאות עתידיות, אך כרגע תצטרכו לחבר לו מודל טקסט לדיבור בנפרד.

האם אפשר להשתמש בו לשיחות בעברית?

לא מומלץ. עברית אינה מופיעה ברשימת השפות הנתמכות של המודל, והוא אומן על שפות כמו אנגלית, ערבית, צרפתית וספרדית בלבד.

איך מריצים

כדי להריץ אותו מקומית תצטרכו כרטיס מסך עם לפחות 24 גיגה זיכרון כדי לטעון 15.1 גיגה של משקלי המודל בפורמט bfloat16 יחד עם ההקשר והשמע. המפתחים עצמם מציינים ביצועים על גבי כרטיס A100 עם 40 גיגה זיכרון, כך שחומרה ביתית פשוטה תתקשה להחזיק אותו בקצב סביר.

ההרצה מתבצעת ישירות דרך ספריית transformers הרגילה עם צינור עבודה שמקבל קובץ קול ומערך שיחה, אך דורשת הפעלת trust_remote_code. אם אין לכם שרת ייעודי זמין ברציפות, עדיף להשתמש בתשתית ענן מנוהלת או שירות חיצוני במקום להחזיק מאיץ גרפי כבד דולק סביב השעון.

from transformers import pipeline

pipe = pipeline("audio-text-to-text", model="fixie-ai/ultravox-v0_4")
print(pipe("שלום"))

הרישיון

הרישיון הוא MIT, אחד המתירניים ביותר שיש. אתם יכולים להשתמש בו במוצרים מסחריים, לשנות את הקוד ולהפיץ אותו בחופשיות. הדרישה היחידה היא לשמור על הודעת זכויות היוצרים והרישיון המקורי בתוך הפרויקט שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗