GPT
V

VividHead

קוד פתוח

Soul-AILabapache-2.02026-02-06

מאגר וידאו ממוקד פנים שמספק 782 שעות מיושרות ומסוננות היטב ליצירת דיבור חי. הוא חוסך שבועות של חיתוך, ניקוי רעשי עריכה וסנכרון שפתיים מקטעי רשת.

  • 1,521הורדות בחודש
  • 66לייקים

מה זה

המאגר מכיל 330,000 סרטוני וידאו קצרים שמציגים ראש מדבר, כולם חתוכים וממורכזים לרזולוציה אחידה של 512 על 512 בקצב קבוע של 25 פריימים לשנייה. אורך הקטעים נע בין 3 שניות ליותר מדקה, עם ממוצע של 8.37 שניות וריכוז סביב 5 ו־10 שניות. החומר הגולמי נאסף מסרטוני רשת וממאגרי קוד פתוח, ועבר תהליך סינון קפדני.

צינור העיבוד כולל חלוקת סצנות, הסרת כפילויות לפי גיבוב, וזיהוי פנים עם חיתוך ממוקד. מעבר לזה, הסינון מנפה מעברי מצלמה חדים באמצעות זרימה אופטית, מסיר קטעים שבהם הפנים נעלמות, ומסלק חסימות של ידיים על הפנים באמצעות מודל מפתח גוף. סנכרון השמע והתנועה נאכף בעזרת ציוני ביטחון של סינקנט, לצד חילוץ מאפייני אודיו ותיוג תכונות כמו גיל, מגדר, מוצא ושפה עבור כ־60,000 דוברים.

מתאים ל

  • אימון מודלי אנימציית פנים

    אימון מודלי שמע לווידאו ליצירת תנועות שפתיים ודיבור טבעי ברזולוציה ריבועית אחידה.

  • מדד לסנכרון שפתיים

    בחינה והערכה של מודלי התאמת קול לתנועת שפתיים מול קטעים שמפולטרים בצורה מדויקת.

  • הזרמת וידאו רציפה

    פיתוח יישומי דיבור אינטראקטיביים בזמן אמת הדורשים קצב של 25 פריימים לשנייה.

איפה זה נופל

ההטיה הבולטת ביותר היא השפה. אנגלית מכסה 651.4 שעות מתוך 782 השעות במאגר, בעוד שאר 15 השפות מקבלות נפח קטן בהרבה, ועברית אינה מופיעה ברשימת השפות המובילות. קיימת גם הטיה מגדרית ודמוגרפית ברורה, עם 552.8 שעות של גברים לעומת 229 של נשים, ורוב מכריע של 506.7 שעות לבעלי מוצא לבן. בנוסף, חלוקת הגילאים מתרכזת בבני 19 עד 45, כמעט ללא ייצוג לילדים או מבוגרים מעל גיל שישים. הרזולוציה מוגבלת לריבוע קבוע ולא תתאים למי שמחפש וידאו מלא באיכות גבוהה.

שאלות
נפוצות

האם מותר להשתמש במאגר למוצר מסחרי?

לא מומלץ להסתכן בזה כרגע. למרות שבראש העמוד מוגדר רישיון אפאצ'י, בגוף הכרטיס המפתחים מציינים רישיון קריאייטיב קומונס ומגבילים את המאגר לשימוש מחקרי ולא מסחרי בלבד. בנוסף, הסרטונים נאספו מתוכן ציבורי ברשת שאינו כולל ויתור על זכויות יוצרים של המצולמים.

האם יש במאגר דוברי עברית?

התיעוד אינו מציין עברית ברשימת עשר השפות המובילות, שבהן שולטות בעיקר אנגלית וסינית. המאגר כולל מעל 15 שפות בסך הכל, אך השעות שנותרו מעבר לשפות המרכזיות מעטות מאוד. אם אתם בונים מודל שמיועד להגייה בעברית, הנתונים כאן לא יספיקו.

מה היתרון שלו מול מאגרים כמו AVSpeech?

היתרון המרכזי הוא עבודת הניקוי והיישור שכבר נעשתה מראש. במקום קישורים שבורים או וידאו גולמי שמצריך לחתוך פרצופים ולסנן תנועות ידיים, כאן מקבלים 330,000 קטעים חתוכים לפנים, מסונכרנים בקול ומסוננים ממעברי מצלמה חדים.

באיזה פורמט הווידאו מגיע והאם נדרש עיבוד נוסף?

הסרטונים מגיעים בקובצי MP4 חתוכים מראש לגודל של 512 על 512 פיקסלים ובקצב של 25 פריימים לשנייה. הם כוללים מטא-דאטה על גיל, מוצא ומגדר, כך שלא צריך להריץ מודלי זיהוי פנים או נורמליזציה של קצב תמונות לפני האימון.

איך טוענים

הקבצים מאוחסנים בהאגינג פייס וכוללים קטעי וידאו בפורמט MP4. הגישה למאגר ישירה ואינה דורשת אישור מוקדם, אך נפח האחסון הנדרש למאות שעות וידאו מצריך מקום ייעודי מהיר. תגיות המטא-דאטה החשובות כוללות שפה, מגדר, מוצא וקבוצת גיל, לצד מאפייני אודיו שחולצו במודל Wav2Vec.

from datasets import load_dataset

ds = load_dataset("Soul-AILab/VividHead")

הרישיון

קיים פער משפטי בעייתי. בעוד שמטא-דאטת המאגר מציינת רישיון Apache 2.0 המתיר שימוש מסחרי, התיעוד בטקסט קובע במפורש רישיון CC-BY-4.0 המיועד למחקר ולמטרות לא מסחריות בלבד, תוך דרישת ייחוס. במצב כזה אסור להסתמך עליו לאימון מודל מסחרי לפני בירור רשמי מול היוצרים, משום שהגבלת השימוש הלא-מסחרי גוברת.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗