GPT
J

JARVIS

רץ בדפדפן

KingNishרישיון לא דווח2024-04-29

  • gradio

היישום הזה מציע צ'אט קולי מול מודלי שפה פתוחים. אתם מדברים לתוך המיקרופון, והוא עונה בחזרה בקול.

  • הורדות בחודש
  • 291לייקים

מה זה

אתם מדברים למיקרופון בדפדפן, וההקלטה נשלחת לעיבוד. במקום להקליד טקסט ולקרוא תשובה, הממשק מקבל אודיו ומחזיר קובץ שמע עם המענה המדובר של העוזר.

מאחורי הקלעים הקוד מחבר שלושה חלקים שונים. תמלול הדיבור שלכם נעשה באמצעות streaming stt nemo, את התשובה הטקסטואלית מייצרים דרך מודלי שפה שונים שזמינים לבחירה כמו Llama 3 8B, Mixtral 8x7B, Mistral 7B או Phi 3 mini, והמרת הטקסט החוזר לדיבור מתבצעת בעזרת edge tts. התוצאה היא מעין שרשרת של דיבור לטקסט, עיבוד שפה, והחזרה לקול.

הממשק כולל תפריט לבחירת המודל שמייצר את התשובה, סליידר לשליטה בערך ה־seed של הריצה, ורכיבי אודיו ייעודיים לקלט ולפלט בליווי קובץ עיצוב מותאם.

מתאים ל

  • בדיקת מודלים בקול

    השוואת התשובות של Llama 3 או Mixtral כשמדברים אליהם ישירות.

  • תרגול שיחה באנגלית

    דיבור למיקרופון וקבלת תשובה קולית מוקראת לתרגול שפה.

  • הדגמת שרשרת קולית

    בחינה איך חיבור של תמלול, מודל שפה והקראה עובד בפועל.

איפה זה נופל

החומרה של היישום מבוססת על מעבד בלבד, כך שלא מדובר בשיחה שוטפת בזמן אמת אלא בהמתנה בין שאלה לתשובה. אם אתם מצפים לתמיכה מלאה בעברית בדיבור, רכיב התמלול והקראת הקול עלולים לזייף או לא לעבוד טוב בהשוואה לאנגלית. בנוסף, מודל השפה עצמו לא שומע אתכם באמת, אלא רק מקבל את הטקסט שחולץ מההקלטה.

שאלות
נפוצות

האם השימוש ביישום עולה כסף?

לא, הגישה להדגמה פתוחה בדפדפן ללא תשלום וללא צורך בהזנת פרטי אשראי. כל עוד המרחב פעיל, אפשר להריץ בו שאילתות קוליות.

האם אפשר להריץ את הקוד מקומית?

הקוד בנוי בעזרת ספריות פייתון סטנדרטיות ו־Gradio, כך שניתן עקרונית להוריד את app.py ולהריץ אותו במחשב שלכם. עם זאת, תצטרכו להגדיר חיבור מתאים לספריות התמלול והקריאות למודלים.

במה זה שונה משימוש רגיל ב־Llama או Mixtral?

במקום להקליד ולקרוא, כאן מתווספת שכבת תמלול בהתחלה ושכבת הקראה בסוף. המודלים עצמם עדיין מעבדים רק טקסט, והמעטפת הקולית היא זו שמשנה את אופן האינטראקציה.

איך משתמשים

לוחצים על כפתור המיקרופון בממשק ומקליטים שאלה בקולכם. בוחרים את המודל הרצוי מהרשימה ומשגרים את הבקשה. השרת רץ על תצורת מעבד בסיסית, cpu-basic. מכיוון שהתמלול והפקת הקול תלויים במעבד הזה והטקסט נשען על קריאות שירות חיצוניות, המענה לא יהיה מיידי ויכול לקחת כמה שניות טובות לכל משפט.

הרישיון

ליוצר אין רישיון מדווח במאגר. המשמעות היא שאין הרשאה ברורה לשימוש מסחרי או להעתקת הקוד לפרויקטים שלכם. קבצי הקול שאתם מקליטים מעובדים בשרת זמני של ההדגמה ומועברים דרך הספריות שמריצות את התמלול והדיבור.

הרישיון המלא ב־Hugging Face ↗