GPT
I

idefics-9b

קוד פתוח

HuggingFaceM4רישיון לא דווח2023-07-11

  • transformers
  • pytorch
  • safetensors
  • idefics
  • image-text-to-text

שחזור פתוח של פלמינגו מבית דיפמיינד, שמקבל שילוב של טקסט ותמונות ופולט טקסט. הוא מתאים למי שחייב מודל ראייה שפה קטן יחסית לאימון עצמי, בלי תלות בשרתים סגורים.

  • 2,048טוקנים בהקשר
  • 66.5 GBמשקל הקבצים
  • 20,442הורדות בחודש
  • 46לייקים

מה זה

מדובר במודל רב מודלי שמחבר מודל שפה של שבעה מיליארד פרמטרים מבוסס LLaMA עם מעבד תמונה מסוג CLIP דרך שכבות קשב ייעודיות. הוא תוכנן לקבל רצף חופשי שבו משולבים טקסטים ומספר תמונות יחד, ולענות עליהם בטקסט רגיל, או לפעול כמודל שפה טהור ללא קלט חזותי כלל.

התוצאות שלו מציגות פער ברור בין אפס דוגמאות לבין למידה מתוך הקשר. בבדיקות של תיאור תמונות כמו COCO, הציון מזנק מ־46 ללא דוגמאות ל־93 עם ארבע דוגמאות בלבד, ובשאלות ויזואליות הוא מגיע לכ־50 אחוז דיוק באפס דוגמאות. זה אומר שבלי כמה דוגמאות בפרומפט, המודל הבסיסי מתקשה להבין בדיוק מה רוצים ממנו.

מתאים ל

  • בסיס לכוונון מולטי מודלי

    משמש נקודת מוצא טובה ל־fine-tuning על נתוני תמונה וטקסט פנימיים בזכות משקלים פתוחים וגודל של תשעה מיליארד פרמטרים.

  • למידה מכמה דוגמאות

    מספק יכולת הדגמה של מספר תמונות וטקסטים ברצף אחד, כדי לכוון למבנה התשובה הרצוי בלי לאמן את המודל מחדש.

  • ניתוח רצף של כמה תמונות

    מתאים להשוואה בין שתי תמונות עוקבות או יצירת סיפור קצר שמבוסס על מספר קלטים חזותיים במקביל.

איפה זה נופל

זהו מודל בסיס שלא עבר כוונון להוראות, ולכן הוא לא יודע לנהל שיחה ישירה עם משתמש אלא רק להמשיך רצפי טקסט, כשהיוצרים עצמם ממליצים להעדיף את גרסת ה־instruct לשימוש יומיומי. בנוסף, חלון ההקשר עומד על 2,048 טוקנים בלבד, מה שמגביל מאוד שילוב של יותר משתיים או שלוש תמונות יחד עם היסטוריה ארוכה, ורזולוציית התמונה אומנה על 224 על 224 פיקסלים בלבד כך שטקסטים קטנים בתוך תמונה כמעט לא ניתנים לפענוח. המודל אומן באנגלית בלבד ואינו כולל תמיכה מובנית בעברית.

אותה משפחה

idefics יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל מבין עברית?

לא, המודל אומן על מאגרי מידע באנגלית בלבד כמו ויקיפדיה האנגלית ומאגר OBELICS. הוא לא מיועד לטפל בפרומפטים בעברית או לזהות טקסט מקומי.

האם כדאי להוריד אותו לשימוש ישיר בצ'אט?

לא, זהו מודל בסיס שלא אומן לעקוב אחרי הוראות שיחה. אם המטרה היא מענה לשאלות משתמש, עדיף להוריד ישירות את idefics-9b-instruct שעבר fine-tuning מתאים.

כמה זיכרון וידאו צריך כדי לטעון אותו?

בדיוק מלא של bfloat16 דרוש כרטיס עם לפחות 24 ג'יגה בייט זיכרון כדי לטעון את המשקלים ולבצע הסקה. בקוונטיזציה של 4 ביט אפשר להסתפק בחומרה צנועה יותר כמו כרטיס של 16 ג'יגה בייט.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־66.5 ג'יגה בייט בפורמט bfloat16, מה שדורש בערך 18 עד 20 ג'יגה בייט זיכרון וידאו להרצה ישירה, או כרטיס בודד של 24 ג'יגה בייט אם מפעילים קוונטיזציה של 4 ביט. אפשר לאמן אותו ב־LoRA עם 4 ביט על גבי שרת בסיסי, והוא רץ ישירות דרך ספריית transformers.

בגרסת הבסיס הזו אין אירוח מנוהל ב־API של Hugging Face, כי החברה מציעה ממשק מרוחק רק לגרסאות ה־instruct. לכן, אם אתם רוצים להשתמש במודל הזה בדיוק בלי להוריד עשרות ג'יגה בייטים לתחנה שלכם, תצטרכו להקים שרת עצמאי או לעבור ישר לגרסת ההוראות.

from transformers import pipeline

pipe = pipeline("text-generation", model="HuggingFaceM4/idefics-9b")
print(pipe("שלום"))

הקבצים

54 קבצים במאגר, 66.5 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון לא דווח בעמוד המודל. במצב כזה אין אישור כתוב וברור לשימוש מסחרי או הפצה בתוך מוצר, וההשלכה היא סיכון משפטי ישיר למי שמטמיע אותו במערכת מסחרית בלי לקבל הבהרה רשמית מהיוצרים.

הרישיון המלא בעמוד המודל ↗