GPT
V

visual_chatgpt

רץ בדפדפן

microsoftosl-3.02023-03-09

  • gradio

microsoft עומדים גם מאחורי Sho, ויש עליו סקירה כאן.

ממשק שיחה שמחבר מודל שפה לסדרה של כלי ראייה ממוחשבת ויצירת תמונות. אתם מתכתבים, מעלים קבצים, והוא מפעיל מודלים שונים כדי לנתח או לערוך אותם לפי ההוראות שלכם.

  • הורדות בחודש
  • 749לייקים

מה זה

החלון מציג צ'אט שבו שולחים טקסט או מעלים קובץ תמונה. המערכת מחזירה תשובות טקסטואליות לצד תמונות חדשות או מעובדות, בהתאם לפעולה שביקשתם לבצע בשיחה. אחת הדוגמאות המובנות בממשק מדגימה יצירה של חתול רץ בגינה.

מאחורי הקלעים רץ סוכן LangChain שמחובר ל־OpenAI ולשרשרת של מודלים חזותיים. מאחר שמודל השפה לא רואה תמונות בעצמו, הוא מקבל תיאור טקסטואלי שהופק על ידי כלי כמו BLIP, ומחליט אילו כלים להפעיל בהמשך. הרשימה כוללת בין היתר את Stable Diffusion v1.5 ליצירה, גרסת Inpainting לתיקונים, ControlNet ו־Canny לשליטה במבנה, Midash להערכת עומק, ו־Instruct-Pix2Pix לעריכה מונחית הוראות.

מתאים ל

  • עריכת תמונות לפי פקודה

    העלאת תמונה קיימת ושינוי אלמנטים מתוכה באמצעות פקודות טקסט שנשלחות למודל עריכה כמו Instruct-Pix2Pix.

  • יצירה מבוקרת של תמונות

    הפקת תמונות חדשות מאפס בעזרת Stable Diffusion בשילוב ControlNet לשמירה על גבולות וקומפוזיציה.

  • שאילת שאלות על תמונות

    קבלת מענה על שאלות בנוגע לפרטים בתוך תמונה שהעליתם, תוך שימוש במודלים ייעודיים לראייה ממוחשבת.

איפה זה נופל

הבעיה המרכזית כרגע היא שההדגמה שבורה ולא זמינה לשימוש חי. מעבר לכך, כל עיבוד תמונה דורש שרשור של מספר מודלים כבדים דרך מודל שפה, מה שמייצר תלות מוחלטת במפתח חיצוני של OpenAI וגורר איטיות. המודל עלול גם לפרש לא נכון את התוכן החזותי בגלל ההסתמכות על תיאור ביניים בטקסט במקום קריאה ישירה של הפיקסלים.

שאלות
נפוצות

האם השימוש באפליקציה בחינם?

הגישה להדגמה עצמה חופשית, אבל אי אפשר לשלוח הודעות בלי להזין מפתח API פרטי של OpenAI. כל שאלה או קריאה מורידה קרדיט מחשבון ה־OpenAI שלכם.

למה מופיעה שגיאה כשאני מנסה להיכנס?

הסביבה נמצאת כרגע במצב RUNTIME_ERROR בשרת של Hugging Face. כדי שהיא תעבוד, תצטרכו לשכפל אותה לחשבון שלכם ולפתור את בעיות התלויות או ההרצה של הקוד.

כמה זמן לוקח לכל בקשה להסתיים?

התהליך אורך זמן ממושך יחסית לצ'אט רגיל. כל פעולה מערבת פנייה ל־OpenAI, בחירת כלי, וטעינת מודלי תמונה כבדים כמו Stable Diffusion או ControlNet על גבי המעבד הגרפי.

האם אפשר להריץ את זה מקומית במחשב?

כן, הקוד מבוסס על ספריות פתוחות כמו LangChain ו־Gradio. עם זאת, נדרש מחשב עם חומרה חזקה מאוד וכרטיס מסך מתאים כדי לטעון ולהריץ את כל מודלי הראייה במקביל.

איך משתמשים

כדי להתחיל צריך להזין מפתח API של OpenAI ולבחור שפת ממשק בין אנגלית לסינית. רק אחרי הזנת המפתח שורת הקלט נפתחת, ואז אפשר להקליד טקסט, להעלות תמונה בכפתור הייעודי וללחוץ על Run. המערכת מוגדרת לרוץ על חומרת a10g-large, אבל כרגע הדף מדווח על שגיאת ריצה (RUNTIME_ERROR), כך שאי אפשר להפעיל אותה ישירות בדפדפן בלי לשכפל את הסביבה או לתקן את הקוד.

הרישיון

הפרויקט מפורסם תחת רישיון osl-3.0. זהו רישיון קוד פתוח שמאפשר שימוש ושינוי אך כולל דרישות שיתוף תחת אותו רישיון במקרה של הפצה או שינוי הקוד, ללא התייחסות מפורשת בקוד לגבי בעלות על תוצרי התמונות.

הרישיון המלא ב־Hugging Face ↗