GPT
M

MiniGPT-v2

רץ בדפדפן

Vision-CAIR-Adminother2023-10-15

  • gradio

הדגמה לניתוח תמונות שמשלבת מודל שפה עם ראייה ממוחשבת. מיועדת למי שרוצה לבדוק זיהוי אובייקטים ושיחה על תוכן ויזואלי בדפדפן.

  • הורדות בחודש
  • 113לייקים

מה זה

אתם מעלים תמונה וכותבים שאלה או פקודה בתיבת הטקסט. בתמורה מקבלים תשובה בצ'אט, כולל תיאורים מפורטים, שירים, או איתור מיקומים בתוך הפריים לפי קואורדינטות. הממשק כולל דוגמאות מובנות שממחישות משימות שונות: זיהוי ספות באמצעות פקודת זיהוי ייעודית, איתור גביע העולם, שאלות על מקומות מחבוא בחדר, וזיהוי פריט ספציפי לפי תחום מוגדר מראש.

מאחורי הקלעים רץ שילוב של מודלי ראייה ושפה. לפי הקוד וההגדרות, המערכת נשענת על מודל EVA לראייה ממוחשבת, מודלי שפה מסדרת Llama 2 בגודל שבעה מיליארד פרמטרים, רכיבים של MiniGPT-4, ומודלי BERT. החיבור הזה מאפשר למודל השפה לפרש את הנתונים שמגיעים מעיבוד התמונה, להבין פקודות מובנות בסוגריים מרובעים, ולענות על שאלות בהקשר חזותי.

מתאים ל

  • זיהוי ומיקום אובייקטים

    מאתר פריטים ספציפיים בתמונה ומחזיר את המיקום שלהם באמצעות פקודות ייעודיות.

  • מענה על שאלות ויזואליות

    מנתח סצנות בחדר או במרחב ועונה על שאלות הגיון לגבי הפרטים שמופיעים בהן.

  • כתיבה יצירתית על תמונות

    מייצר טקסטים חופשיים או שירים המבוססים על האווירה והאלמנטים בתמונה שהעליתם.

איפה זה נופל

הקוד מסתמך על תגיות מיוחדות כמו זיהוי או איתור בסוגריים מרובעים. בלי התחביר המדויק הזה, המודל עשוי לפספס את הכוונה ולא לסמן מיקומים. בנוסף, בסיס השפה הוא Llama 2 ואין כאן התאמה לשפה העברית, כך ששאלות בעברית עלולות להניב שגיאות או הזיות. הדוגמאות המוכנות מציגות מקרים אידיאליים, ובמציאות תמונות מורכבות או עמוסות מדי עלולות להוביל לזיהוי שגוי של אובייקטים.

שאלות
נפוצות

האם השימוש בהדגמה עולה כסף?

לא, השימוש בדפדפן פתוח לחלוטין ואינו דורש תשלום. המשאבים מוקצים על גבי שרתי Spaces לפי דרישה. אין צורך להזין פרטי אשראי או ליצור חשבון כדי לנסות את היכולות.

כמה זמן לוקח לקבל תשובה?

העיבוד אורך בדרך כלל מספר שניות בודדות מרגע השליחה. מכיוון שהחומרה מבוססת על הקצאה גמישה, לפעמים יש עיכוב ראשוני של כדקה אם השרת היה כבוי וצריך להתעורר. לאחר מכן התגובות מהירות.

האם הקבצים והתמונות שלי נשמרים?

התמונות שאתם מעלים מעובדות לצורך הפקת התשובה ומאוחסנות זמנית בזיכרון הריצה של השרת. כיוון שמדובר בהדגמה ציבורית ברשת, עדיף לא להעלות מסמכים פרטיים, תמונות אישיות או מידע עסקי רגיש.

האם אפשר להריץ את זה באופן מקומי?

כן, הקוד מבוסס על פרויקט קוד פתוח שמשתמש בספריות מוכרות כמו PyTorch ו־Transformers. כדי להריץ אותו על המחשב תצטרכו כרטיס מסך ייעודי בעל זיכרון מתאים, מכיוון שהמודל דורש משאבים כבדים להרצה חלקה.

איך משתמשים

גוררים תמונה לחלון השמאלי, מקלידים פקודה או שאלה בתיבה, ולוחצים על כפתור השליחה. אפשר לכוונן את מדד היצירתיות בעזרת הסליידר או לבחור באחת הדוגמאות המוכנות בתחתית העמוד. ההדגמה רצה על מאיץ A10G שמוקצה לפי דרישה, כך שאם המשאב אינו פעיל באותו רגע תיתכן המתנה קצרה עד להתנעתו. אין צורך בהרשמה או בהתחברות כדי להתחיל.

הרישיון

הרישיון של המרחב מוגדר כ־other, ללא פירוט תנאים מדויק במסמכים. המודל מסתמך על Llama 2 ורכיבים נוספים בעלי רישיונות משלהם, לכן לא מומלץ להעלות חומרים רגישים או להסתמך על התוצאות לשימוש מסחרי לפני בדיקת הרישיונות המקוריים.

הרישיון המלא ב־Hugging Face ↗