GPT
C

Cinemo

רץ בדפדפן

maxin-cnרישיון לא דווח2024-07-27

  • gradio
  • Image-2-Video
  • LLM
  • Large Language Model

הופך תמונות סטילס לקטעי וידאו קצרים מונפשים לפי הנחיית טקסט. מתאים למי שרוצה לבדוק מחקר בתחום יצירת וידאו מתמונה.

  • הורדות בחודש
  • 205לייקים

מה זה

מעלים תמונה, כותבים הנחיה של מה שאמור לקרות בה, ומקבלים קובץ וידאו שמונפש סביב התמונה המקורית. הממשק כולל אפשרות להוסיף הנחיה שלילית, ובאפשרויות המתקדמות יש שליטה בעוצמת התנועה, מספר צעדי הדגימה ופרמטרים ייחודיים לסינון רעשים בתדרים. הדוגמאות המוצגות מראות הליכה של אנשים, גלי ים, דמות רוקדת ועיני דרקון זוהרות.

מאחורי הקלעים רץ שילוב של מודל Cinemo עם משקלי Stable Diffusion בגרסאות שונות ורכיב טקסט של CLIP. המודל מתמקד בלימוד שאריות התנועה בין פריימים במקום ליצור כל פריים מאפס, ומשתמש בטרנספורמציית קוסינוס בדידה לייצוב התנועה לאורך זמן.

מתאים ל

  • הנפשת תמונות סטילס

    יצירת תנועה עדינה בתמונות נוף, גלי ים או דמויות הולכות על פי הנחיית טקסט קצרה.

  • בדיקת איכות של מודל מחקר

    בחינת יכולות המודל והשפעת פרמטרי DCT על יציבות תנועה לעומת מחוללי וידאו אחרים.

  • הכנת רקעים מונפשים קצרים

    הפקת לולאות וידאו פשוטות ברזולוציה נמוכה לשימוש מהיר ברשתות או במצגות.

איפה זה נופל

רזולוציית הפלט מוגבלת ומקובעת בממשק לרוחב 512 על גובה 320 פיקסלים, בלי אפשרות לשנות את הממדים ישירות במסך. למרות שהקוד המקורי מאפשר עריכת וידאו והעברת תנועה, ממשק הווב הנוכחי מציג אך ורק אנימציה של תמונה בודדת. זהו כלי הדגמה מחקרי, ולא מערכת להפקת תוצרי וידאו מסחריים ארוכים.

שאלות
נפוצות

האם השימוש בממשק עולה כסף?

לא, ההרצה בעמוד פתוחה ללא תשלום. היא מנצלת משאבי חישוב משותפים של Hugging Face וזמינה כל עוד יש מכסות פנויות בחומרה.

מה קורה לתמונות שאני מעלה לכאן?

התמונות נשלחות לשרת ענן ומעובדות עליו כדי לייצר את קובץ הווידאו. מאחר שזהו שרת הדגמה ציבורי, לא מומלץ להעלות מידע רגיש או תמונות פרטיות.

אפשר להריץ את הכלי על המחשב שלי?

כן, הקוד ומשקלי המודל פורסמו בקוד פתוח. דף הפרויקט כולל הנחיות התקנה לקונדה וקובצי הפעלה, אבל נדרש כרטיס מסך חזק כדי להריץ אותם באופן עצמאי.

איך משנים את גודל הווידאו שנוצר?

בגרסת הדפדפן הזאת הממדים נעולים על 512 על 320 פיקסלים. מי שרוצה רזולוציות אחרות או אפשרויות עריכה נוספות צריך להוריד את הקוד ולהריץ אותו ידנית.

איך משתמשים

גוררים תמונה או מדביקים קישור, כותבים תיאור של התנועה ולוחצים Generate. הריצה מתבצעת על מעבד גרפי A10G דרך תשתית ZeroGPU של Hugging Face, כך שאם השרת במצב שינה תצטרכו להמתין להקצאת החומרה לפני תחילת העיבוד. ברירת המחדל מוגדרת על 50 צעדי דגימה, ולכן יצירת הווידאו דורשת בדרך כלל המתנה של כמה עשרות שניות.

הרישיון

הרישיון של המרחב מסומן כלא דווח, והקוד מפנה לקובץ נפרד. במצב כזה אין הרשאה ברורה לשימוש מסחרי, וכל תמונה שמועלית מעובדת בשרתי הענן הציבוריים.

הרישיון המלא ב־Hugging Face ↗