GPT
W

whisper-to-stable-diffusion

רץ בדפדפן

fffiloniרישיון לא דווח2022-09-22

  • gradio

האפליקציה מחברת בין תמלול קולי ליצירת תמונות, עבור מי שרוצה להקליט תיאור במקום להקליד אותו. מקליטים או מעלים קובץ שמע, ומקבלים תמונה שנוצרת לפי המילים שנאמרו.

  • הורדות בחודש
  • 115לייקים

מה זה

האפליקציה מחברת בין שני מודלים נפרדים בתוך ממשק gradio אחד. בצד הקלט אתם מקליטים קול ישירות דרך הדפדפן או מעלים קובץ שמע קיים. האודיו נשלח למודל whisper-large-v2 של sanchit-gandhi, שמתמלל את הדיבור ומתרגם אותו לטקסט באנגלית שמוצג בתיבות ייעודיות על המסך.

משם, הטקסט המתורגם הופך להנחיה שנשלחת אל Stable Diffusion, במקור מבוסס CompVis/stable-diffusion-v1-4 שנטען דרך ספייס של stabilityai. הפלט מופיע כגלריית תמונות בתוך הממשק, כשיש אפשרות מובנית בקוד לשלוט בהגדרות כמו מספר הצעדים בין 10 ל־50, סולם ההנחיה בין 2 ל־15, ובחירת seed אקראי.

מתאים ל

  • יצירת תמונה מדיבור

    מקליטים תיאור קולי באודיו במקום להקליד פרומפט, ומקבלים תמונה ישירות מהטקסט שתומלל.

  • תרגום שמע לפרומפט

    משתמשים ביכולת התרגום של whisper כדי להמיר שפות זרות לטקסט תיאורי באנגלית עבור המודל.

  • התאמת פרמטרים ליצירה

    מכוונים את מדדי הצעדים וסולם ההנחיה בלוח ההגדרות כדי להשפיע על התוצאה הסופית.

איפה זה נופל

הבעיה המיידית היא שהאפליקציה מושהית ולא זמינה לשימוש כרגע. מעבר לכך, היא לא מריצה מודל מקומי אלא נשענת על ספייסים חיצוניים של whisper ו־Stable Diffusion, כך שאם אחד מהם משתנה או נופל, כל התהליך נשבר. חומרת cpu-basic גם מצביעה על עיבוד איטי מאוד אם מנסים להריץ עליה ישירות.

שאלות
נפוצות

האם אפשר להשתמש באפליקציה עכשיו בחינם?

היא הייתה פתוחה ללא תשלום, אך כרגע היא במצב PAUSED ולכן אי אפשר להריץ אותה בדפדפן. כדי להשתמש בה תצטרכו לשכפל את הקוד לחשבון שלכם. פעולה כזו עשויה לדרוש משאבי חומרה משלכם.

מה קורה עם קובצי השמע שאני מקליט או מעלה?

הקבצים מעובדים בממשק gradio ונשלחים למימושים חיצוניים שמריצים את whisper. מכיוון שלא דווח רישיון או פירוט על שמירת מידע, אין מידע על משך שמירת ההקלטות. מומלץ לא להעלות הקלטות רגישות.

במה היא שונה משימוש רגיל ב־Stable Diffusion?

במקום להקליד הנחיה טקסטואלית באנגלית, האפליקציה מציעה ממשק דיבור. היא מטפלת בשלב התמלול והתרגום בעזרת whisper לפני שהטקסט מגיע למודל התמונה. הקוד עצמו רק מחבר בין שני השירותים הללו.

האם אפשר להריץ את זה מקומית על המחשב?

הקוד פתוח וכולל קובץ app.py קצר שמשתמש בספריית gradio. אפשר להוריד אותו ולהריץ בסביבה מקומית, אבל תצטרכו להגדיר גישה למודלים של whisper ו־Stable Diffusion. ללא כרטיס מסך מתאים, הריצה המקומית תהיה כבדה ואיטית.

איך משתמשים

לוחצים על הקלטה או בוחרים קובץ שמע. יש אפשרות לבדוק קודם את התמלול והתרגום בלחיצה על כפתור בדיקה, או ללחוץ ישר על יצירה ישירה. כרגע האפליקציה נמצאת במצב PAUSED על מעבד cpu-basic בסיסי, כך שלא ניתן להריץ אותה ישירות בדפדפן בלי הפעלה מחדש.

הרישיון

הרישיון לא דווח בעמוד של האפליקציה. המשמעות היא שאין הרשאה ברורה לגבי שימוש מסחרי בקוד או בזכויות על התוצר, ולא ידוע מה נעשה עם קובצי השמע שמועלים.

הרישיון המלא ב־Hugging Face ↗