GPT
I

idefics-80b-instruct

קוד פתוח

HuggingFaceM4other2023-07-25

  • transformers
  • pytorch
  • safetensors
  • idefics
  • image-text-to-text

שחזור פתוח של Flamingo מבית דיפמיינד, שמחבר טקסט ותמונות יחד ומקבל רצפים מעורבבים של שניהם. הוא מיועד למי שחייב מודל ראייה שפה ענק בקוד פתוח עם כוונון להוראות.

  • 80Bפרמטרים
  • 298 GBמשקל הקבצים
  • 5,738הורדות בחודש
  • 188לייקים

מה זה

מדובר במודל רב מודלי שמבוסס על שילוב בין Llama 65B ומקודד התמונות CLIP ViT H 14. מחברים ביניהם בלוקים מאומנים של Perceiver וקשב מוצלב. המודל מקבל רצף חופשי של פסקאות ותמונות כקלט ופולט טקסט. גרסת ה־instruct הזו עברה כוונון עדין על שילוב מאגרי דיאלוגים והוראות, רובם סונתזו באמצעות מודלים של OpenAI, כדי לשפר תגובה לבקשות ישירות של משתמש.

במבחני ביצועים מול המודל הסגור המקורי, הוא מציג יכולות דומות ב־few shot על משימות תיאור תמונה ומענה לשאלות ויזואליות. ב־VQAv2 הוא מגיע ל־60% ללא דוגמאות ומטפס עד 65.9% עם 32 דוגמאות בהקשר. עם זאת, במשימות שדורשות הבנת טקסט בתוך תמונה כמו TextVQA, הוא נעצר באזור ה־30.9% באפס דוגמאות ומגיע לכל היותר ל־36.7%, מה שמראה הבנה ויזואלית כללית סבירה אבל קושי בקריאת פרטים חדים.

מתאים ל

  • תשאול מבוסס תמונות מרובות

    מאפשר להזין מספר תמונות יחד עם טקסט ולבקש השוואה או תיאור עלילתי עקבי.

  • בסיס לכוונון במחקר אקדמי

    משמש נקודת מוצא פתוחה וגדולה לחקר חיבורי Cross-Attention בין טקסט לראייה ממוחשבת.

  • חילוץ תובנות מתמונות כלליות

    עונה היטב על שאלות חופשיות באנגלית לגבי סצנות וצילומים ברזולוציה סטנדרטית.

איפה זה נופל

המודל אינו מייצר תמונות כלל, אלא רק טקסט. הרזולוציה של תמונות הקלט מוגבלת ל־224 על 224 פיקסלים, הרבה פחות מהמקור של דיפמיינד, מה שפוגע ביכולת שלו לזהות אובייקטים קטנים או לקרוא טקסט מורכב. במבחני Winoground הוא משיג רק 8% בציון הקבוצתי, עדות לחולשה בהבנת קשרים תחביריים מורכבים מול התמונה. בנוסף, הוא אומן באנגלית בלבד ואינו מתאים לעבודה בעברית.

אותה משפחה

idefics יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להשתמש במודל בעברית?

המודל אומן על נתונים באנגלית בלבד. הוא אינו מיועד לעבד קלט בעברית או לייצר פלט בעברית, ולכן לא יתאים לממשקים מקומיים ללא תרגום מקדים.

האם הוא מסוגל לקרוא מסמכים וטקסט מתוך תמונות?

היכולת שלו בנושא מוגבלת מאוד. רזולוציית הקלט של 224 פיקסלים והציון הנמוך במבחני TextVQA מראים שהוא יתקשה מאוד בחילוץ טקסט מובחן.

האם כדאי להוריד אותו במקום את גרסת ה־9B?

רק אם יש לכם תשתית של מאות גיגה בייט VRAM ואתם חייבים את אחוזי הדיוק העודפים. לרוב הבדיקות והפיתוחים, גרסת ה־9B Instruct זולה ופשוטה בהרבה.

איך מריצים

המשקל של הקבצים מגיע ל־298GB ב־50 קבצים שונים. כדי לטעון אותו בדיוק bfloat16 דרוש שרת עם מספר מאיצים גרפיים וזיכרון VRAM כולל של לפחות 160GB עד 200GB רק כדי להחזיק את הפרמטרים, עוד לפני שמחשבים את הקשר הריצה של התמונות. המפתחים מספקים תמיכה בכימות ל־4 ביט שמקצצת את דרישות הזיכרון, אך עדיין מדובר במפלצת שמחייבת חומרה ארגונית ייעודית.

גרסת ה־9B הקטנה יותר של אותה משפחה נתמכת גם ב־Colab יחיד באמצעות LoRA וכימות, כך שלבדיקות היתכנות היא עדיפה בהרבה. אם המטרה היא רק תשאול נקודתי ולא אימון מחדש של השכבות, עדיף להשתמש ב־Text Generation Inference של Hugging Face שמארחת אותו, במקום להתעסק בתחזוקת שרת כבד ויקר כזה.

from transformers import pipeline

pipe = pipeline("text-generation", model="HuggingFaceM4/idefics-80b-instruct")
print(pipe("שלום"))

הקבצים

50 קבצים במאגר, 298 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון מוגדר כ־other ואינו מפורט במלואו בנתונים. בפועל, היות שהוא נשען ישירות על משקלי הבסיס של LLaMA המקורית ונעזר בנתוני הדרכה שסונתזו ממודלים של OpenAI, יש מגבלות שימוש משמעותיות. השימוש בו במוצר מסחרי בעייתי מאוד עד בלתי אפשרי מבחינה משפטית, והוא מתאים בעיקר למחקר ולניסויים.

הרישיון המלא בעמוד המודל ↗