GPT
L

LongVU

רץ בדפדפן

Vision-CAIR-Adminרישיון לא דווח2024-10-08

  • gradio

מעלים סרטון ושואלים שאלות על מה שקורה בו. מתאים למי שחוקר הבנת וידאו ארוך במודלים פתוחים ורוצה לבדוק את התוצאות בלי להקים שרת בעצמו.

  • הורדות בחודש
  • 91לייקים

מה זה

הממשק מקבל קובץ וידאו ושאלת טקסט חופשית, ומחזיר תשובות מילוליות בחלונית שיחה. יש בו גם שלוש דוגמאות מובנות של קובצי וידאו בפורמט mp4 שמוכנים להרצה בלי להעלות קבצים מהמחשב.

מאחורי הקלעים רץ שילוב של שלושה מודלים. העיבוד החזותי נשען על dinov2-giant של פייסבוק ועל siglip של גוגל, כשהטקסט והבנת ההקשר מנוהלים דרך LongVU המבוסס על שפת Qwen2 עם שבעה מיליארד פרמטרים. לפי המחקר שמצורף לקוד, המערכת דוחסת מידע במרחב ובזמן כדי לנתח סרטונים ארוכים בלי להתפוצץ בזיכרון.

מתאים ל

  • ניתוח תוכן מתוך וידאו

    מעלים קובץ ושואלים שאלות על רצף האירועים, הפעולות שמתבצעות או מטרת המתרחש.

  • בדיקת יכולות Qwen2 בווידאו

    בוחנים איך המודל של שבעה מיליארד פרמטרים מתמודד עם שאלות מורכבות על סמך פריימים.

  • התנסות מהירה בדוגמאות

    מריצים שאילתות על שלושת סרטוני ההדגמה בלי להמתין להעלאת קבצים כבדים מהמחשב.

איפה זה נופל

ההדגמה נמצאת במצב שינה ולא תמיד תגיב מיד, וייתכנו נפילות עקב חריגה במשאבי המאיץ השיתופי. בנוסף, חלון התשובות מוגבל על ידי סליידר הטוקנים ולא מיועד לפלטים ארוכים מאוד. כדאי לזכור שהמודל אומנם מכיל שבעה מיליארד פרמטרים, אבל איכות התשובה תלויה ביכולת שלו לקרוא את הפריימים בקצב שמוגדר בקוד, כך שפרטים קטנים או מהירים עלולים להתפספס.

שאלות
נפוצות

האם השימוש בהדגמה כרוך בתשלום?

לא, הגישה דרך הדפדפן היא בחינם ואינה דורשת תשלום. עם זאת, מכיוון שהיא רצה על חומרת שיתופית במצב שינה, ייתכן שתצטרכו להמתין להפעלת השרת.

כמה זמן לוקח לקבל תשובה?

בפעם הראשונה יש המתנה של כמה דקות עד שהשרת נדלק וטוען את המודלים. לאחר מכן, זמן העיבוד תלוי באורך הסרטון ובכמות הפריימים שהקוד מפענח דרך המעבד הגרפי.

מה קורה עם הסרטונים שמעלים לשם?

הקבצים נשלחים לתשתית של האגינג פייס לצורך העיבוד על השרת. מכיוון שלא פורסמו תנאי רישיון או מדיניות פרטיות ספציפית בעמוד, לא מומלץ להעלות חומרים רגישים או אישיים.

האם אפשר להריץ את המערכת מקומית?

כן, הקוד מסתמך על מודלים ציבוריים שפתוחים להורדה, כמו משקולות LongVU_Qwen2_7B. להרצה עצמאית תצטרכו מחשב עם מעבד גרפי חזק שיכול להחזיק בזיכרון את מודלי התמונה והטקסט יחד.

איך משתמשים

טוענים וידאו, מקלידים שאלה בשורת הטקסט ולוחצים על כפתור השליחה. יש סליידרים ידניים לקביעת טמפרטורה, top_p וכמות טוקנים מרבית לתשובה, כך שאפשר לשלוט על היצירתיות ואורך הפלט.

ההדגמה רצה על מאיץ A10G בתצורת זירו של האגינג פייס, אבל כרגע היא במצב שינה. כשתיכנסו, תצטרכו לחכות שהשרת יתעורר ויוריד את המשקולות של Qwen2 ושאר המודלים, תהליך שלוקח כמה דקות לפני שאפשר להריץ שאילתה ראשונה.

הרישיון

הרישיון של המרחב הזה לא דווח. המשמעות היא שאין הרשאה ברורה לשימוש מסחרי בקוד או בפלטים, ולא מוגדר רשמית מה נעשה עם סרטונים שאתם מעלים לחומרה של האגינג פייס.

הרישיון המלא ב־Hugging Face ↗