GPT
P

pe-av-large

קוד פתוח

facebookapache-2.02025-09-12

  • safetensors
  • pe_audio_video

מודל שמייצר וקטורים משותפים לאודיו, וידאו וטקסט. הוא מיועד לחיפוש ושליית מידע בין המדיות השונות בדיוק הגבוה ביותר בסדרה שלו.

  • 2.2Bפרמטרים
  • 8,192טוקנים בהקשר
  • 8.3 GBמשקל הקבצים
  • 59,154הורדות בחודש

מה זה

מדובר באנקודר מולטימודלי של פייסבוק שממפה סאונד, תמונות וידאו וטקסט לאותו מרחב וקטורי. אפשר להזין לו קובץ שמע נפרד, וידאו ללא קול, וידאו מלא עם פס קול או טקסט, והוא יודע לחלץ ייצוג שמקשר בין כולם. המטרה העיקרית כאן היא חיפוש והתאמה, למשל למצוא קטע וידאו לפי תיאור מילולי או לפי קובץ קול דומה.

בבדיקות של המפתחים הגרסה הזו מובילה עם ציון אחזור ממוצע של 51.6, לעומת 48.2 בגרסה שנדגמת ל־16 פריימים ו־48.1 בגרסת הסמול. המשמעות היא שהמודל הזה בוחן את כל הפריימים בווידאו באורך משתנה ולא מסתפק בדגימה חלקית, מה שמשפר את הדיוק בזיהוי רגעים ספציפיים על חשבון עוד כוח חישוב.

מתאים ל

  • חיפוש וידאו לפי טקסט

    מאתר קטעי וידאו מתוך מאגר לפי תיאור מילולי חופשי, בזכות המרחב המשותף לטקסט ולתמונה.

  • שליפת וידאו לפי סאונד

    מאפשר למצוא קטעי וידאו מתאימים על בסיס קובץ אודיו בלבד, ישירות דרך הייצוג הקולי.

  • אינדוקס מולטימודלי מלא

    מייצר וקטור אחד שמשקלל גם את התמונה וגם את פס הקול של הסרטון לחיפוש מדויק.

איפה זה נופל

המודל הזה הוא אנקודר בלבד, כלומר הוא מחזיר וקטורים ולא מייצר תשובות, שיחות או סיכומים בטקסט. בנוסף, עיבוד של כל הפריימים בווידאו ארוך יוצר צוואר בקבוק כבד בזמן ריצה ובצריכת זיכרון, במיוחד בטעינת קבצים מרובים במקביל. יש לבדוק היטב את ביצועי השליפה על חומרים מגוונים לפני שילוב במערכת ייצור, שכן לא פורסמו פרטים לגבי התנהגותו עם שפות שאינן אנגלית או בתנאי רעש קשים.

שאלות
נפוצות

האם המודל יודע לענות על שאלות לגבי הווידאו?

לא. המודל מייצר וקטורים נומריים של המידע לצורכי חיפוש וסיווג, ולא פולט טקסט. אם המטרה היא צ'אט שמסביר מה קורה בווידאו, תצטרכו לחבר אותו למודל שפה נפרד.

מה ההבדל בינו לבין גרסת ה־16 פריימים?

גרסת ה־16 פריימים לוקחת מספר קבוע ומצומצם של תמונות לאורך הווידאו וחוסכת זיכרון, בעוד הדגם הזה מעבד את כל הפריימים. הוא מדויק יותר בחיפוש אך דורש משמעותית יותר כוח חישוב.

האם המודל מתאים לשימוש מסחרי בישראל?

כן, הרישיון הוא Apache 2.0 שמתיר שימוש מסחרי ללא תמלוגים. כל עוד שומרים על תנאי הקרדיט הנדרשים ברישיון, אפשר להטמיע אותו במוצרים מסחריים מקומיים ובינלאומיים.

איך מריצים

כדי להריץ אותו צריך כרטיס מסך עם לפחות 16 עד 24 גיגה זיכרון, שכן המשקלים תופסים מעל 8 גיגה בזיכרון לפני עיבוד הפריימים והאודיו. המודל עובד דרך ספריית perception_models של פייסבוק או דרך transformers עם bfloat16, ואפשר להשמיט מדיות שלא רלוונטיות לשאילתה.

אם הווידאו שלכם ארוך במיוחד ומשאבי החישוב מוגבלים, שווה לבדוק את גרסת ה־16 פריימים שרצה מהר יותר, או לקרוא ל־API חיצוני אם אין לכם תשתית GPU ייעודית לתהליכי אינדוקס כבדים.

pip install -U huggingface_hub
hf download facebook/pe-av-large

הרישיון

רישיון apache-2.0 מאפשר שימוש מסחרי חופשי לחלוטין. מותר להריץ, לשנות, לשלב במוצר סגור ולהפיץ אותו, בתנאי ששומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗