GPT
I

idefics-9b-instruct

קוד פתוח

HuggingFaceM4other2023-07-24

  • transformers
  • pytorch
  • safetensors
  • idefics
  • image-text-to-text

שחזור קוד פתוח של Flamingo שמשלב תמונות וטקסט חופשיים, עם כיוונון הוראות לשיחה. הוא שוקל כמעט תשעה מיליארד פרמטרים ומתאים למי שחייב מודל ראייה מקומי על שרת יחיד.

  • 8.9Bפרמטרים
  • 2,048טוקנים בהקשר
  • 33.3 GBמשקל הקבצים
  • 882הורדות בחודש

מה זה

הארכיטקטורה מחברת מודל שפה של שבעה מיליארד פרמטרים עם מקודד תמונה של CLIP דרך שכבות מגשרות. הוא מקבל רצף מעורב של תמונות וטקסט ופולט טקסט, בלי יכולת לייצר תמונות בחזרה. גרסת ההוראות עברה כיוונון עדין על שיחות ומידע שחולץ ממודלים מסחריים, ולכן היא עונה ישירות במקום להמשיך טקסט עיוור.

במבחני הבנה ויזואלית רואים את הפער מול גרסת ה־80B. בדיוק על שאלות תמונה פתוחות ב־0-shot הוא מגיע ל־50.9 בלבד, וקריאת טקסט מתוך תמונה חלשה מאוד עם 25.9. ככל שמוסיפים לו דוגמאות בתוך הפרומפט הביצועים עולים, אבל הוא נשאר מודל קטן עם מגבלות תפיסה ברורות.

מתאים ל

  • תיאור תמונות בשרת מקומי

    הוא מנתח תמונות באנגלית ומחזיר תיאור קצר, מתאים כשיש דרישת פרטיות מלאה.

  • שאלות על רצף תמונות

    יודע לקבל כמה תמונות ברצף ולהשוות ביניהן לפי הוראה מילולית.

  • כיוונון למשימת ראייה צרה

    משמש בסיס נוח ל־LoRA של 4 ביט על כרטיס יחיד לצורך סיווג ייעודי.

איפה זה נופל

המודל אומן רק על אנגלית, כך שאין מה לבנות עליו לעברית. רזולוציית התמונות באימון הוגבלה ל־224 על 224 פיקסלים, מה שמסביר למה הוא מתקשה מאוד לפענח טקסט קטן או פרטים עדינים בתמונות.

חלון ההקשר עומד על 2,048 טוקנים בלבד. ברגע שמכניסים שתיים או שלוש תמונות שמקודדות להרבה טוקנים, נשאר מעט מאוד מקום להיסטוריית שיחה או לפרומפט מפורט.

אותה משפחה

idefics יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל מבין עברית?

לא. המודל אומן ונבדק על נתונים באנגלית בלבד. אם תפנו אליו בעברית הוא יחזיר ג'יבריש או שייכשל בהבנת ההוראה.

אפשר להריץ אותו על כרטיס מסך ביתי?

בדיוק המקורי של 16 ביט צריך מעל 20 ג'יגה זיכרון וידאו, מה שמחייב כרטיס יקר. עם זאת, בכימות ל־4 ביט אפשר לדחוס אותו לכרטיס של 12 או 16 ג'יגה ולבצע הסקת מסקנות בלי בעיה.

האם הוא מסוגל לקרוא מסמכים סרוקים?

ממש לא מומלץ לבנות עליו לזה. המודל אומן על רזולוציה נמוכה של 224 על 224 ומציג תוצאות חלשות מאוד במבחני פענוח טקסט מתוך תמונה.

איך מריצים

המשקלים תופסים 33.3 ג'יגה בייטים ב־bfloat16. כדי להריץ אותו בלי כימות תצטרכו כרטיס מקצועי עם לפחות 24 עד 48 ג'יגה זיכרון גרפי. אם דוחסים אותו ל־4 ביט, אפשר להריץ ולהתאים אותו אפילו על כרטיס בודד בסיסי.

יש גרסת בסיס ויש גרסת 80 מיליארד, אבל לרוב השימושים גרסת ה־9B instruct היא היחידה שהגיוני להרים לבד בלי אשכול שרתים יקר. אם אתם צריכים רק שאילתות מדי פעם, כדאי לשלוח קריאות ל־API מוכן במקום להחזיק חומרה כבדה דולקת.

from transformers import pipeline

pipe = pipeline("text-generation", model="HuggingFaceM4/idefics-9b-instruct")
print(pipe("שלום"))

הרישיון

הרישיון מוגדר כ־other בכרטיס המודל ומבוסס על שילוב מודלי מקור. מכיוון שאימון ההוראות השתמש בנתונים שיוצרו עם ChatGPT ו־GPT-4, ומודל השפה המקורי הוא LLaMA הראשון, יש הגבלות מסחריות כבדות. לא הייתי משלב אותו במוצר מסחרי סגור בלי בדיקה משפטית של תנאי השימוש של מודלי הבסיס.

הרישיון המלא בעמוד המודל ↗