GPT
V

VideoLLaMA2

רץ בדפדפן

lixin4everapache-2.02024-06-12

  • gradio
  • Multimodal
  • language models
  • LLMs

הכלי מנתח תמונות וסרטוני וידאו ומאפשר לנהל איתם שיחה טקסטואלית ישירה. הוא מיועד למי שרוצה לשאול שאלות על תוכן ויזואלי ולקבל תשובות מפורטות בדפדפן.

  • הורדות בחודש
  • 160לייקים

מה זה

אתם מעלים קובץ תמונה או סרטון וידאו, כותבים שאלה בתיבת הטקסט ומקבלים תשובה בצ'אט. הממשק כולל דוגמאות מובנות של תמונות כמו גיהוץ אקסטרים, נוף למים או מדבר, וסרטונים קצרים שמציגים קטעי ראפ והדגמות נוספות לבדיקה מהירה.

מאחורי הקלעים רץ הקוד של VideoLLaMA2 יחד עם מודלים ממשפחת DAMO-NLP-SG בגרסאות שבעה מיליארד פרמטרים, לצד רכיבים כמו vicuna ו־opt. המערך הזה משלב עיבוד ויזואלי עם מודל שפה כדי לחלץ משמעות מרצף פריימים או מתמונה בודדת, תוך שליטה בפרמטרים של יצירת הטקסט כמו טמפרטורה, top-p ומספר אסימונים מרבי.

מתאים ל

  • תיאור תוכן של סרטון

    מעלים קובץ וידאו ומבקשים סיכום מילולי של ההתרחשויות לאורך הקליפ.

  • מענה על שאלות מתמונה

    מזינים צילום ומבררים אילו חפצים, מקומות או פעולות מופיעים בו.

  • ניסוי פרמטרים של המודל

    משנים ערכי טמפרטורה ואורך טקסט כדי לראות איך ההסברים משתנים.

איפה זה נופל

ההדגמה מוגבלת לחומרה של שרת שיתופי, כך שסרטונים ארוכים מדי או קבצים באיכות גבוהה עלולים להיתקל במגבלת זיכרון או בזמני עיבוד ארוכים. הממשק אמנם מציע כפתורי דירוג ושליטה, אך אפשרויות מסוימות כמו עצירת ייצור הטקסט באמצע מנוטרלות בקוד. אל תצפו לתמיכה מלאה ומדויקת בעברית מורכבת, כי המודלים אומנו בעיקר על אנגלית. בנוסף, חילוץ פרטים קטנים או מעקב אחר תנועות מהירות בווידאו עלולים להוביל להזיות בטקסט.

שאלות
נפוצות

האם השימוש כרוך בתשלום?

הגישה בדפדפן פתוחה ללא תשלום ואינה דורשת כרטיס אשראי. המשאבים מוקצים במסגרת שרת שיתופי.

כמה זמן לוקח לקבל תשובה?

עבור תמונה המענה לוקח בדרך כלל כמה שניות. בווידאו העיבוד דורש ניתוח של מספר פריימים, ולכן ההמתנה מתארכת בהתאם לגודל הקובץ.

האם אפשר להריץ את זה מקומית?

הקוד והמודלים זמינים תחת רישיון פתוח, כך שניתן להתקין אותם על מחשב עצמאי. עם זאת, נדרש כרטיס מסך חזק כדי להחזיק מודל שפה ווידאו במקביל.

האם הקבצים שלי נשמרים?

הקבצים מועלים לעיבוד בשרת שמריץ את הממשק ואינם מיועדים לאחסון קבוע. עדיין עדיף לא להזין סרטונים אישיים או מסמכים רגישים.

איך משתמשים

גוררים תמונה או וידאו לחלון המתאים, מקלידים שאלה בשדה התחתון ולוחצים על כפתור השליחה או על אנטר. בצד יש אפשרות לכוונן מדדים כמו טמפרטורה ואורך הפלט כדי להשפיע על התשובות.

העיבוד רץ על גבי מעבד גרפי מסוג A10G שמוקצה לפי דרישה. זה אומר שאין צורך בהתקנה או בהרשמה מיוחדת, אבל ייתכן שתמתינו כמה שניות להקצאת החומרה לפני תחילת הניתוח, במיוחד בעבודה עם קובצי וידאו כבדים.

הרישיון

הפרויקט מפורסם תחת רישיון apache-2.0 שמתיר שימוש חופשי ובדיקה של הקוד. המידע והקבצים שאתם מעלים עוברים דרך השרת של הממשק כדי לעבד את התשובה, ולכן לא מומלץ להעלות חומרים פרטיים או רגישים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗