GPT
I

image-to-music-v2

רץ בדפדפן

fffiloniרישיון לא דווח2024-02-01

  • gradio
  • mcp-server

מעלים תמונה ומקבלים קטע מוזיקלי שנבנה לפי האווירה שלה. הכלי מתאים ליוצרי תוכן שרוצים לבדוק איך מודלים שונים מפרשים ויז'ואל לצליל.

  • הורדות בחודש
  • 574לייקים

מה זה

אתם מעלים תמונה ובוחרים מודל מתוך הרשימה, או לוחצים על אחת מתשע הדוגמאות המוכנות, כמו ציור המונה ליזה, סנטה, או טיול שלג. המערכת שמאחורי הקלעים עובדת בשרשרת. קודם כל Kosmos-2 מנתח את התמונה ומוציא תיאור טקסטואלי.

אחר כך מודל שפה, בקוד מופיע Zephyr או Mixtral, לוקח את התיאור של התמונה ובונה ממנו הנחיה מוזיקלית מפורטת. בשלב האחרון, ההנחיה נשלחת למודל יצירת המוזיקה שבחרתם, ביניהם גרסאות שונות של MAGNeT, כדי להפיק את קובץ האודיו הסופי. הממשק מחזיר גם את נגן השמע וגם את הפרומפט שנוצר, כך שאפשר לערוך אותו ולנסות שוב.

מתאים ל

  • השוואת מודלים

    בודקים איך מנועי סאונד שונים כמו גרסאות MAGNeT מגיבים לאותו תיאור ויזואלי.

  • בניית רעיונות לסאונד

    מחלצים הנחיות טקסט מוזיקליות מתמונות אווירה כדי להשתמש בהן בהפקות המשך.

  • התאמת פסקול לתמונה

    מייצרים דגימת אודיו קצרה שמשקפת את מצב הרוח של איור או צילום.

איפה זה נופל

הקשר בין התמונה למוזיקה עקיף לחלוטין. אם Kosmos-2 מפספס את הפרטים בתמונה, מודל השפה יבנה פרומפט לא מדויק, והמוזיקה תצא לא קשורה בלי קשר לאיכות מודל הסאונד. בנוסף, הקוד כולל שגיאות מובנות למודלים שעדיין לא מוכנים לשימוש, כך שלא כל אפשרות שתבחרו ברשימה בהכרח תעבוד. מומלץ לבדוק קודם את הפרומפט הטקסטואלי שיצא לפני שמסיקים מסקנות על איכות הצליל.

שאלות
נפוצות

האם השימוש עולה כסף?

הכלי פתוח לשימוש חופשי בדפדפן דרך החומרה המוקצית לו בשרת. אין צורך לשלם או להזין פרטי אשראי כדי לטעון תמונה ולהפיק מוזיקה.

כמה זמן לוקח לכל תמונה להתעבד?

התהליך לוקח זמן מורגש כיוון שהוא מריץ שלושה מודלים שונים ברצף. מאחר והחומרה מבוססת על הקצאת A10G לפי דרישה, ייתכן עיכוב נוסף אם השרת מתעורר או אם יש עומס משתמשים.

מה קורה לתמונות שאני מעלה?

הקבצים מועברים ישירות לשרת שמריץ את המרחב לצורך ניתוח התמונה והפקת הסאונד. מאחר שלא צוינה מדיניות פרטיות נפרדת, לא כדאי להעלות לשם תמונות רגישות או אישיות.

במה הכלי שונה מהרצת המודל ישירות?

הוא לא מודל חדש אלא צינור שמחבר ניתוח ראייה ממוחשבת, מודל שפה שמנסח פרומפט מוזיקלי, ומודל סאונד. הרצה של מודל המוזיקה לבדו דורשת מכם לכתוב תיאור טקסטואלי בעצמכם.

איך משתמשים

גוררים תמונה למשבצת, בוחרים מודל יצירה בתיבת הבחירה ולוחצים על הכפתור שמייצר מוזיקה. הריצה מתבצעת על חומרת zero-a10g בענן של Hugging Face, מה שנותן כוח עיבוד של כרטיס גרפי ברגע שיש בקשה פעילה. בגלל שמדובר בכמה תחנות עיבוד שרצות בזו אחר זו, ניתוח תמונה, כתיבת פרומפט והפקת סאונד, זה לוקח זמן ולא קורה מיידית. אין צורך בהתחברות כדי להתחיל.

הרישיון

הרישיון לא דווח בעמוד של המרחב. במצב כזה אין הרשאה מפורשת לשימוש מסחרי בקוד או בפלטים, והזכויות על המודלים הבסיסיים כמו MAGNeT ו־Zephyr תלויות בתנאי הרישיון המקוריים של החברות שפרסמו אותם.

הרישיון המלא ב־Hugging Face ↗