GPT
M

mPLUG-Owl

רץ בדפדפן

MAGAer13apache-2.02023-05-04

  • gradio

מעלים תמונה או וידאו ומנהלים שיחה מבוססת טקסט על מה שרואים בהם. הכלי מיועד למי שרוצה לבדוק הבנה ויזואלית של מודל רב-מודאלי ישירות בדפדפן.

  • הורדות בחודש
  • 174לייקים

מה זה

אתם מעלים תמונה בפורמט רגיל או קובץ וידאו, ומקלידים שאלות בתיבת שיחה לצד המדיה. הפלט מתקבל כתשובת טקסט בתוך ממשק צ'אט, כשהמודל מנתח את התוכן החזותי ומשיב לפרומפטים חופשיים.

מאחורי הממשק רץ שרת שמפעיל את mPLUG-Owl ומבוסס על שילוב של מודל שפה ממשפחת LLaMA עם נתונים ממקורות כמו ShareGPT. דוגמאות המערכת מראות שימושים של הסבר ממים, כתיבת שירים ופרסומות לפי תמונה, זיהוי יצירות אמנות וניתוח שלבי עלילה מתוך צילומי מסך.

מתאים ל

  • הסבר ממים ותמונות

    מעלים מם לא ברור או בדיחה ויזואלית ומבקשים ניתוח מפורט של הפאנלים וההומור.

  • ניתוח תוכן מתוך סרטון

    מזינים קובץ וידאו קצר ובוחרים כמות פריימים כדי לשאול מה קורה בעלילה.

  • כתיבת תוכן שיווקי למוצר

    מעלים תמונה של פריט מעוצב ומבקשים ניסוח של טקסט פרסומי מותאם.

איפה זה נופל

הבעיה המרכזית כרגע היא שההדגמה כלל לא פעילה ומדווחת על שגיאת ריצה. מעבר לזה, חומרת T4 חלשה מדי לעיבוד מהיר של סרטוני וידאו כבדים עם 32 פריימים, כך שגם כשהקוד עובד זמני המענה צפויים להיות איטיים.

אי אפשר להסתמך על הכלי לניתוח טכני מדויק, והוא לא מקבל קובצי אודיו או מסמכי טקסט ארוכים.

שאלות
נפוצות

האם האפליקציה עובדת עכשיו בחינם?

היא חינמית לגמרי, אך כרגע היא נמצאת במצב של תקלת הרצה ולא מייצרת תשובות. צריך להמתין שהמפתח יעדכן את השרת.

אפשר להשתמש בתשובות לפרויקטים מסחריים?

לא. למרות שהקוד מופיע עם רישיון אפאצ'י, הקוד מציין הגבלות של LLaMA ו־ShareGPT שמחייבות שימוש מחקרי ולא מסחרי בלבד.

אילו קבצים אפשר להעלות לניתוח?

הממשק תומך בקובצי תמונות רגילים ובקובצי וידאו. אין אפשרות להעלות קובצי קול, מסמכים או קישורים חיצוניים.

האם אפשר להריץ את זה מקומית על המחשב?

כן, הקוד בנוי על בסיס Gradio וקוד פתוח של mPLUG-Owl. עם זאת, תצטרכו מחשב עם מעבד גרפי מתאים כדי להריץ את המודלים.

איך משתמשים

בפועל נכנסים לדף, מעלים קובץ למלבן התמונה או הווידאו, כותבים שאלה בתיבה ולוחצים על שליחה. יש אפשרות לפתוח תפריט פרמטרים מתקדם כדי לכוונן טמפרטורה, כמות פריימים מתוך וידאו בין 8 ל־32, ומספר טוקנים מקסימלי עד 1024.

אין צורך בהתחברות או תשלום כדי להשתמש. המערכת מוגדרת לרוץ על מעבד גרפי T4-medium, אבל כרגע היא במצב שגיאת ריצה ולא תגיב לפקודות עד שהיוצר יתקן אותה.

הרישיון

הפרויקט מוגדר תחת רישיון apache-2.0, אך הקוד מציין מפורשות שמדובר בתצוגה מקדימה למחקר בלבד ולשימוש לא מסחרי. ההגבלה נובעת מתנאי הרישיון של LLaMA ונתוני OpenAI ו־ShareGPT.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗