GPT
G

gemma-avatar

רץ בדפדפן

victorרישיון לא דווח2026-07-03

  • docker

האפליקציה מחברת שיחה קולית בזמן אמת עם אווטאר תלת-ממדי שמזיז את השפתיים ומגיב להבעות. היא מיועדת למי שרוצה לבדוק ממשק דיבור מול מודל שפה בלי להסתפק בחלון טקסט רגיל.

  • הורדות בחודש
  • 170לייקים

מה זה

אתם מדברים ישירות למיקרופון, והקול שלכם עובר שרשרת עיבוד שלמה. בהתחלה silero-VAD מזהה מתי התחלתם וסיימתם לדבר, הדגם parakeet-tdt-1.1b הופך את הדיבור לטקסט, המודל google/gemma-4-31B-it שמתוחזק על Cerebras מייצר את התשובה, והדגם Qwen3-TTS הופך אותה בחזרה לקול.

במקביל לשמע, הדפדפן מרנדר ראש תלת-ממדי באמצעות ספריית TalkingHead על בסיס three.js. תנועות השפתיים לא מגיעות מתוזמנות מראש מהשרת. רכיב שרץ בדפדפן מנתח את גלי הקול בזמן אמת, מפרק אותם לפריימים של MFCC ומתאים להם תנועות פה בעיכוב של כחמישים מילישניות. המודל עצמו גם מפעיל פקודות שמורות לחיוך, משיכת כתפיים או מחוות ידיים תוך כדי שיחה.

מתאים ל

  • הדגמת שיחה קולית

    בדיקת תקשורת קולית מול Gemma 4 עם אווטאר שמגיב לדיבור ומחווה מחוות.

  • בדיקה ללא מיקרופון

    הרצה עם פרמטר fakemic כדי לבחון את הממשק והאנימציה בלי לחבר ציוד שמע.

  • שילוב דמויות מותאמות

    טעינת דמויות מ־Ready Player Me שכוללות תמיכה בפה ובהבעות תלת-ממדיות.

איפה זה נופל

אם תעברו לטאב אחר בדפדפן, האנימציה של האווטאר תקפא לגמרי כי הרינדור תלוי ישירות בפריימים פעילים של המסך, למרות שהסאונד ימשיך להתנגן. המערכת דורשת מודלים תלת-ממדיים מאוד ספציפיים שכוללים התאמות של Mixamo וצורות blend של Oculus ושל ARKit. בנוסף, המודל מבוסס על תשתית שרתים חיצונית, ואם רוצים לעבוד מקומית חייבים להגדיר כתובת שרת קולי פעיל או פרוקסי בהגדרות.

שאלות
נפוצות

האם האפליקציה דורשת תשלום?

השימוש בממשק שרץ ברשת אינו דורש תשלום מראש לפי המידע הקיים. עם זאת, הרצה עצמאית דורשת חיבור לשרת קולי פעיל שעשוי להיות כרוך בעלויות תשתיות משלו.

מה קורה עם קול המיקרופון שלי?

השמע נשלח בזמן אמת כזרם נתונים של שש-עשרה קילו-הרץ דרך חיבור רשת ישיר לשרת העיבוד. הוא מעובד לטקסט לצורך הפקת התשובה ומנותח בדפדפן כדי להזיז את השפתיים של הדמות.

האם אפשר להריץ את הכל מקומית על המחשב?

אפשר להוריד את קוד הדפדפן ולהריץ אותו במחשב, אבל חייבים להגדיר כתובת שרת חיצונית של speech-to-speech בהגדרות. המחשב שלכם מריץ את התלת-ממד, לא את מודל השפה עצמו.

במה הממשק שונה משימוש רגיל ב־Gemma 4?

כאן לא מתכתבים בצ'אט טקסטואלי, אלא מדברים בקול. המודל מתמלל אתכם, מדבר בחזרה בעזרת מודל שמע ייעודי, ומפעיל פקודות שמזיזות את הדמות ומשנות את הבעות הפנים שלה תוך כדי הדיאלוג.

איך משתמשים

לוחצים על Start talking ומתחילים לדבר אל המיקרופון של המחשב. התקשורת עובדת בפרוטוקול Realtime של OpenAI דרך WebSocket מול השרת של האגינג פייס, בקצב דגימה של 16 קילו-הרץ לשני הכיוונים. אפשר לקטוע את האווטאר באמצע דיבור והוא עוצר במקום. למרות שהמכולה הזו יושבת על מעבד בסיסי, העיבוד הקולי הכבד והרצת המודלים מתבצעים בשרתים ייעודיים מאחורי הקלעים, כך שהמעבד המקומי בעיקר מגיש את ממשק הרשת.

הרישיון

היוצר לא דיווח על רישיון לתוכנה הזו. כשאין רישיון מוגדר, הקוד והחומרים לא מורשים אוטומטית לשימוש מסחרי או להפצה מחדש, ואי אפשר להסתמך עליהם לפיתוח מסחרי בלי אישור מפורש ממי שהעלה אותם.

הרישיון המלא ב־Hugging Face ↗