GPT
U

ultravox-v0_5-llama-3_2-1b

קוד פתוח

fixie-aimit2025-02-06

  • transformers
  • safetensors
  • ultravox
  • feature-extraction
  • audio-text-to-text

מודל שפה קומפקטי שיודע לקבל אודיו וטקסט ישירות ולהחזיר תשובה כתובה. הוא מחבר בין מודל שמיעה של וויספר למודל שפה של מטא ומיועד למענה קולי מהיר בלי לשרשר תמלול נפרד.

  • 683Mפרמטרים
  • 1.3 GBמשקל הקבצים
  • 143,504הורדות בחודש
  • 96לייקים

מה זה

הארכיטקטורה מחברת ישירות בין המקודד של וויספר טורבו לבין לאמה 3.2 בגודל מיליארד פרמטרים. במקום לתמלל את האודיו לטקסט ורק אז להעביר אותו למודל שפה, הקלט הקולי מומר לוקטורים שמוזנים ישר לתהליך היצירה. החיבור הזה חוסך שלב שלם בצנרת ומקצר את זמני התגובה.

באימון שמרו על בסיס הטקסט קפוא, כיווננו את המקודד של וויספר ואימנו מתאם שמנסה להתאים את הפלטים לאלה של מודל הטקסט המקורי. התוצאה היא מודל שיודע להבין שאלות קוליות ולענות עליהן בטקסט, אבל היכולות שלו נשארות ברמה של מודל שפה קטן מאוד. בבנצ'מרק של ביג בנץ' אודיו הוא מקבל ציון 39.14 בלבד לעומת מעל 66 בגרסת השמונה מיליארד, כך שיכולת ההסקה מוגבלת למשימות בסיסיות למדי.

מתאים ל

  • בוט קולי פשוט במכשיר קצה

    מענה מהיר לפקודות קוליות מוגדרות מראש בחומרה מקומית חלשה.

  • ניתוח שמע קצר לטקסט

    מענה על שאלות מתוך הקלטות קוליות קצרות באנגלית ללא תמלול ביניים.

  • פיתוח ובדיקת צנרת מולטימודל

    איטרציות מהירות בסביבת פיתוח מקומית לפני מעבר למודלים כבדים.

איפה זה נופל

הנתונים מראים נפילה חדה במשימות מורכבות ובתרגום. במבחני קובוסט 2 מאנגלית לערבית הוא מגיע לציון 1.55 בלבד, ומאנגלית לקטלאנית לציון 8.06, תוצאות שמעידות על חוסר שימושיות בתרגום מורכב בשפות אלה לעומת הגרסאות הגדולות יותר. בנוסף, לא בוצע שום כוונון העדפות אנושיות, ולכן התשובות עשויות להיות גולמיות ולא צפויות. המודל גם אינו מייצר דיבור בעצמו אלא פולט טקסט בלבד, ורשימת השפות הנתמכת רשמית אינה כוללת עברית.

שאלות
נפוצות

האם המודל מדבר בחזרה?

לא. הוא מקבל קול וטקסט כקלט, אבל התוצר שהוא מחזיר הוא טקסט רגיל בלבד. כדי להפיק ממנו קול צריך לחבר את הפלט שלו למנוע דיבור חיצוני.

האם כדאי להשתמש בו לתרגום קולי?

התוצאות במבחני התרגום הרשמיים נמוכות מאוד בגודל הזה, במיוחד בשפות שאינן אנגלית, רוסית או ספרדית. למשימות תרגום עדיף לפנות לגרסת השמונה מיליארד פרמטרים ומעלה.

איך מריצים

המשקל הכולל יושב על 1.3 גיגה בייט בלבד, מה שאומר שאפשר להריץ אותו מקומית על כמעט כל מחשב פיתוח מודרני, שרת צנוע או אפילו מכשיר קצה עם מעט זיכרון. הטעינה נעשית דרך ספריית הטרנספורמרס הרגילה יחד עם ליברוסה לטעינת האודיו, ודורשת הרצה עם הרשאת קוד מרוחק.

בגלל המשקל הנמוך, אין סיבה אמיתית לחפש בשבילו ספק ענן חיצוני בתשלום אם יש לכם כרטיס גרפי בסיסי זמין. יחד עם זאת, אם אתם רוצים ביצועים של ממש ותרגום אמין, הגרסאות הגדולות של שמונה או שבעים מיליארד פרמטרים הן אלה שצריך לבדוק, ושם כבר תצטרכו תשתית משמעותית בהרבה.

from transformers import pipeline

pipe = pipeline("audio-text-to-text", model="fixie-ai/ultravox-v0_5-llama-3_2-1b")
print(pipe("שלום"))

הרישיון

הפרויקט מופץ תחת רישיון MIT. זהו רישיון מתירני שמאפשר שימוש מסחרי מלא, שינוי של הקוד והמשקלים והפצה בתוך מוצרים סגורים, בלי דרישה לפתוח את הקוד שלכם ובתנאי ששומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗