GPT
L

Llama3.1-s-v0.2

רץ בדפדפן

jan-hqmit2024-08-22

  • gradio

הדגמה שמאפשרת לשוחח עם מודל שפה באמצעות קול או לתמלל הקלטות. היא מיועדת למי שרוצה לבדוק יכולות שמע ישירות בתוך מודל מבוסס לאמה בלי להגדיר שרת משלו.

  • הורדות בחודש
  • 115לייקים

מה זה

אתם בוחרים בין הזנת טקסט להעלאת קובץ קול. אם כותבים טקסט, אפשר לייצר ממנו אודיו סינתטי, ואת האודיו שנוצר או שהעליתם שולחים אל המודל. יש שני כפתורי פעולה עיקריים: שיחה עם המודל על בסיס השמע, או בקשה ישירה לתמלל את מה שנאמר בקובץ. הפלט מתקבל כטקסט.

מאחורי הקלעים רצה שרשרת כלים כבדה. המודל המרכזי הוא Menlo/llama3-s-instruct-v0.2, כשלצידו פועלים רכיבים מבית WhisperSpeech, מודל הזיהוי הקולי pyannote, ומודלים נוספים כמו MusicGen ו־vocos. הממשק מכיל גם דוגמאות מובנות שמחולקות לקבצים מוצלחים וקבצים בעייתיים, כך שאפשר לראות מראש איפה הזיהוי עובד טוב ואיפה הוא נוטה להתבלבל.

מתאים ל

  • בדיקת יכולות שמע בלאמה

    הערכה מעשית של האופן שבו גרסת ה־S של לאמה מבינה פקודות קוליות ישירות ללא תמלול חיצוני מקדים.

  • תמלול הקלטות קצרות

    העלאת קובץ קול ולחיצה על כפתור התמלול כדי לחלץ את הטקסט ישירות מהמודל.

  • בדיקת דוגמאות קצה

    הרצת הדוגמאות הבעייתיות המובנות כדי להבין מתי המודל נכשל ומה גבולות הדיוק שלו בעיבוד אודיו.

איפה זה נופל

זו נקודת ביקורת מוקדמת מאוגוסט 2024 ולא מוצר מוגמר. העובדה שהמפתחים שמו בממשק תיקיית דוגמאות גרועות מראה שהמודל מתקשה בהקלטות מסוימות, ברעשי רקע או בדיבור לא ברור. בנוסף, הממשק מחזיר טקסט בלבד ולא תשובה קולית מדוברת, והוא בנוי על מודלים באנגלית כך שאין מה לבנות עליו לעברית.

שאלות
נפוצות

האם השימוש עולה כסף?

לא, השימוש בדפדפן חופשי לחלוטין ואינו דורש תשלום. המשאבים מוקצים על גבי תשתית משותפת, כך שאין צורך להזין פרטי אשראי.

מה קורה עם קובצי הקול שמועלים לשם?

הקבצים נשלחים לעיבוד על השרת שמריץ את הממשק. היות שמדובר בסביבת הדגמה ציבורית, לא כדאי להעלות הקלטות עם פרטים אישיים, שיחות סודיות או מידע עסקי.

האם אפשר להריץ את זה על המחשב?

כן, הקוד מבוסס על ספריות פתוחות כמו transformers ו־gradio עם רישיון mit. תצטרכו כרטיס מסך חזק, רצוי ברמה של החומרה בענן, כדי לטעון את כל המודלים במקביל.

במה הממשק שונה מהרצת המודל עצמו?

הממשק מחבר כמה מודלים יחד לשרשרת אחת, כולל סינתזת קול, המרה וזיהוי דוברים. הוא מספק מעטפת חזותית ודוגמאות מוכנות, במקום שתצטרכו לכתוב קוד פייתון שמנהל את כל הרכיבים הללו.

איך משתמשים

נכנסים לדף, בוחרים אם להעלות קובץ אודיו או להקליד טקסט שיהפוך לשמע, ולוחצים על הכפתור המתאים לתמלול או לצ׳אט. אין צורך בהרשמה או התחברות. השרת רץ על מעבד גרפי מסוג zero-a10g שמקצה משאבים לפי דרישה. זה אומר שאם המערכת הייתה במנוחה תיתכן המתנה קצרה להפעלה, אבל בזמן עיבוד הריצה תהיה מהירה יחסית, אלא אם יש עומס משתמשים בו זמנית.

הרישיון

הקוד והממשק מפורסמים תחת רישיון mit, שמאפשר שימוש חופשי לחלוטין כולל שינוי והפצה. עם זאת, קובצי הקול והטקסט שתעלו עוברים דרך השרתים שמארחים את המרחב, ולכן לא מומלץ להעלות מידע רגיש או הקלטות פרטיות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗