GPT
S

seamless-streaming — הדגמה

קוד פתוח

facebookcc-by-nc-4.02023-11-28

  • docker

הדגמה לתרגום קולי חי שמיועדת למי שרוצה לבדוק עיבוד דיבור בזמן אמת. פייסבוק העלו כאן שרת פייתון וממשק ריאקט שמחוברים למודל התרגום שלהם.

  • 7.5 GBמשקל הקבצים
  • הורדות בחודש
  • 326לייקים

מה זה

האפליקציה בנויה משני חלקים נפרדים, צד לקוח שנכתב בריאקט ושרת פייתון שמבוסס על uvicorn וספריית fairseq2. המטרה שלה היא לקבל זרם אודיו ישיר מהמשתמש, לעבד אותו תוך כדי דיבור, ולפלוט תרגום קולי רציף בלי לחכות לסוף המשפט. מתחת למכסה רץ המודל facebook/seamless-streaming, שתוכנן לצמצם שיהוי בתרגום סימולטני.

המבנה של הפרויקט כולל תיקיית שרת ייעודית ותיקיית צד לקוח שנבנית עם yarn. השרת מנהל את התקשורת מול המודל ומאפשר להפעיל מצב ניפוי שגיאות ששומר את קובצי האודיו בדיסק המקומי. אין כאן דוגמאות מוקלטות מראש שמתועדות במדריך, אלא מערך שנועד לקלוט קול בזמן אמת דרך הדפדפן ולהחזיר דיבור מתורגם.

מתאים ל

  • בדיקת תרגום דיבור רציף

    הרצת בדיקות מקומיות כדי לראות איך המודל מתמודד עם תרגום תוך כדי דיבור רציף.

  • בסיס לאפליקציית ווב

    שימוש בקוד של שרת ה־uvicorn וממשק הריאקט כשלד לפיתוח ממשק דיבור עצמאי.

  • ניתוח שמירת אודיו בשרת

    הפעלת מצב הדיבאג של השרת כדי להקליט ולנתח קטעי אודיו שנכנסים בזמן אמת.

איפה זה נופל

ההדגמה הזו מוגדרת במקור על חומרת t4-small אבל היא מושהית, כך שאי אפשר ללחוץ ולבדוק אותה בלי לשכפל אותה ולהרים חומרה משלכם. אם תנסו להריץ אותה מקומית על מעבד רגיל ללא כרטיס מסך, המפתחים מזהירים מראש שיהיה שיהוי כבד שיפגע ברעיון של תרגום סימולטני. בנוסף, מדובר בהדגמת קוד שמחייבת התעסקות בספריות ספציפיות כמו fairseq2 בגרסאות פיתוח, ולא במוצר מוכן לעבודה יומיומית.

שאלות
נפוצות

האם זה חינם?

ההדגמה עצמה מושהית כרגע, ולכן אי אפשר להשתמש בה ישירות בחינם. כדי להריץ אותה תצטרכו לשכפל את המרחב לחומרה בתשלום או להוריד את הקוד למחשב שלכם. הרצה מקומית אינה עולה כסף, בהנחה שיש לכם מחשב מתאים.

מה קורה עם הקבצים שלי?

הזרמת הקול מעובדת ישירות בשרת האפליקציה בזמן אמת. אם מפעילים את דגל הדיבאג בהגדרות, השרת שומר עותק של קובצי האודיו בתיקייה פנימית בשם debug. אם משכפלים את המרחב או מריצים מקומית, הקבצים נשמרים בסביבה שנמצאת בשליטתכם.

האם אפשר להריץ מקומית?

כן, התיעוד מסביר איך להתקין את צד השרת עם conda ואיך לבנות את צד הלקוח בעזרת yarn. עם זאת, המפתחים מדגישים שחובה להשתמש בכרטיס מסך עם תמיכת cuda. מעבד רגיל יגרום לשיהוי כבד שלא יאפשר תרגום חי תקין.

במה זה שונה מהמודל עצמו?

המודל הוא משקלי הרשת שדורשים קוד מותאם כדי לטעון אותם ולהזין אליהם קול. המרחב הזה מוסיף שרת uvicorn מלא וממשק דפדפן בריאקט שמקליט את המיקרופון ומציג את התוצאות. זו בעצם עטיפת תוכנה שמנגישה את המודל לשימוש חי.

איך מריצים

אי אפשר להשתמש באפליקציה כרגע ישירות בדפדפן כי היא במצב מושהה. כדי להפעיל אותה צריך לשכפל את המרחב לחשבון שלכם או להתקין אותה מקומית לפי ההוראות. ההתקנה העצמית דורשת סביבת conda עם פייתון 3.8, התקנה של pytorch עם תמיכת cuda, בנייה של צד הלקוח עם nodejs ו־yarn, והרצה של uvicorn. לפי התיעוד הרצה על מעבד רגיל תהיה איטית ותגרום לעיכובים מורגשים בתרגום, כך שצריך כרטיס גרפי תואם.

pip install -U huggingface_hub
hf download facebook/seamless-streaming

הרישיון

הרישיון של המרחב לא דווח בדף הפרויקט. כשהרישיון אינו מצוין, אין היתר שימוש מסחרי מוגדר ולא ברור מה הזכויות המשפטיות לגבי התוכן שמעובד דרכו. בנוסף, במצב ניפוי שגיאות השרת שומר קובצי קול מקומית בתיקיית debug.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗