GPT
V

video-to-music

רץ בדפדפן

fffiloniרישיון לא דווח2024-02-24

  • gradio

האפליקציה מייצרת מוזיקת רקע שתואמת לקטע וידאו ומדביקה אותה עליו. היא מיועדת ליוצרי וידאו שרוצים להתאים פס קול אוטומטי ולהשוות בין מודלים שונים ליצירת מוזיקה מטקסט.

  • הורדות בחודש
  • 76לייקים

מה זה

מעלים קובץ וידאו ובוחרים מודל ליצירת אודיו מתוך תפריט נפתח. בצד השני מקבלים תיאור טקסטואלי של הווידאו, את פרומפט המוזיקה שנבנה ממנו, קובץ שמע בודד, וקובץ וידאו סופי שמכיל את המוזיקה המודבקת.

מאחורי הקלעים הקוד משתמש במודל Kosmos2 כדי לחלץ תיאור מתוך תמונת הווידאו. לאחר מכן מודל שפה, לפי הקוד Zephyr או Mixtral, הופך את תיאור התמונה להנחיה מוזיקלית. ההנחיה הזו נשלחת למודל מוזיקה כמו גרסאות שונות של MAGNet או מודלים נוספים שמופיעים בממשק, ולבסוף moviepy מחבר את האודיו חזרה לווידאו. בדוגמאות המוכנות יש סרטונים קצרים של צב ים, כלבים בשלג ונוף חוף מ־Big Sur.

מתאים ל

  • התאמת פסקול לקליפ קצר

    יצירה מהירה של מוזיקת רקע לסרטון קצר לפי התוכן הוויזואלי שנלכד מתוכו.

  • השוואת מודלים של מוזיקה

    בדיקת איכות הסאונד של מודלים שונים מאותה הנחיה שחולצה מהווידאו.

  • יצירת פרומפטים מוזיקליים

    חילוץ רעיונות להנחיות טקסט של סאונד מתוך תמונות בעזרת מודל השפה.

איפה זה נופל

האפליקציה מוגדרת כרגע במצב מושהה ולא תעבוד בלחיצה פשוטה בלי הפעלה מחדש של השרת. בנוסף, הקוד כולל שגיאה מובנית עבור מודלים שאינם מוכנים עדיין, כך שלא כל האפשרויות ברשימה באמת זמינות להרצה. התהליך מתבסס על ניתוח תמונה סטטית מתוך הווידאו ולא על הבנת התנועה או הקצב לאורך זמן, מה שיכול להוביל לפס קול שלא מתאים לקצב העריכה.

שאלות
נפוצות

האם השימוש באפליקציה כרוך בתשלום?

האפליקציה עצמה פתוחה ואינה גובה תשלום על הרצה רגילה. עם זאת, היא נמצאת כרגע במצב מושהה, וכדי להפעיל אותה ייתכן שתידרש הקצאת חומרה בתשלום בחשבון Hugging Face שלכם.

כמה זמן לוקח לייצר את הווידאו עם המוזיקה?

התהליך דורש מספר שלבים עוקבים של פענוח תמונה, הרצת מודל שפה ויצירת אודיו. על חומרת A10G זה לוקח בדרך כלל בין חצי דקה למספר דקות, תלוי באורך הקטע ובמודל שנבחר.

האם אפשר להריץ את האפליקציה הזו מקומית?

כן, הקוד מבוסס על ספריות פתוחות כמו Gradio, Transformers ו־MoviePy. תצטרכו להוריד את קובץ app.py, להתקין את התלויות ולהחזיק מעבד גרפי מתאים כדי להריץ את שרשרת המודלים.

במה האפליקציה שונה משימוש ישיר במודל מוזיקה?

היא חוסכת את כתיבת הפרומפט ומנתחת את הווידאו בעצמה כדי לייצר את התיאור. בנוסף, היא מחברת אוטומטית את קובץ האודיו החדש בחזרה לקובץ הווידאו המקורי בלי צורך בעריכה ידנית.

איך משתמשים

גוררים וידאו לחלון ההעלאה, בוחרים מודל ברשימה ולוחצים על הכפתור להפקת המוזיקה. לאחר יצירת הפרומפט אפשר לערוך אותו וללחוץ על כפתור הרצה חוזרת. האפליקציה רצה על חומרת zero-a10g שמקצה כרטיס גרפי לפי דרישה, אך כרגע הסטטוס שלה מוגדר כמושהה, כך שלא ניתן להריץ אותה ישירות בדפדפן בלי להפעיל אותה מחדש. הממשק אינו דורש התחברות כשהוא פעיל, אך הדוגמאות לא נשמרות מראש במטמון וזמן הריצה תלוי בתור ובעיבוד התמונה והקול.

הרישיון

הרישיון של המרחב לא דווח בקוד או בתיעוד. המשמעות היא שאין תנאי שימוש מוגדרים לתוכן שנוצר או לקוד עצמו, ומודלים שונים שמופעלים דרכו מחזיקים ברישיונות נפרדים של החברות שפרסמו אותם.

הרישיון המלא ב־Hugging Face ↗