GPT
I

idefics2-8b

קוד פתוח

HuggingFaceM4apache-2.02024-04-09

  • transformers
  • safetensors
  • idefics2
  • image-text-to-text
  • multimodal

מודל מולטימודלי פתוח שמחבר תמונות וטקסט חופשי ביחד. הוא מביא יכולות פענוח מסמכים חזקות לגודל של שמונה מיליארד פרמטרים.

  • 8.4Bפרמטרים
  • 32,768טוקנים בהקשר
  • 31.3 GBמשקל הקבצים
  • 112,206הורדות בחודש

מה זה

הארכיטקטורה משלבת את SigLIP לראייה ממוחשבת יחד עם Mistral-7B לשפה, מה שמאפשר לו לקבל רצף מעורב של תמונות וטקסט ולהחזיר תשובה כתובה. בניגוד לדור הקודם שהיה ענק וכבד, כאן שמרו על ממדים קטנים תוך שמירה על יחס התמונה המקורי ברזולוציה של עד 980 על 980 פיקסלים, בלי לחתוך אותה לריבוע קבוע.

במבחני ביצועים הוא עוקף את הדור הקודם שהחזיק 80 מיליארד פרמטרים, במיוחד בהבנת מסמכים וגרפים. במבחן DocVQA הוא מגיע לציון 74 כשפיצול התמונות מופעל, וגובר על מודלים פתוחים אחרים בקטגוריית שבעה מיליארד כמו DeepSeek-VL.

מתאים ל

  • חילוץ מידע ממסמכים

    מפענח טקסט מתוך צילומי מסמכים, טבלאות ותרשימים מורכבים בזכות אימון ייעודי על נתוני OCR.

  • מענה על שאלות מתמונות

    מקבל תמונה ושאלה טקסטואלית ומחזיר זיהוי קצר ומדויק בלי להעמיס על משאבי המערכת.

  • בסיס לכיוונון משימתי

    מתאים לאימון המשך על נתונים פנימיים באמצעות LoRA בזכות הארכיטקטורה המבוססת על Mistral.

איפה זה נופל

הוא לא יודע לייצר תמונות אלא רק לנתח אותן. החולשה המרכזית בשימוש רגיל היא שהגרסה הזו עונה במשפטים קצרים מאוד, ומי שמחפש הסברים מפורטים או שיחה שוטפת צריך לעבור לגרסת chatty. בנוסף, הוא אומן על אנגלית בלבד, כך שאין מה לבנות עליו לעיבוד מסמכים בעברית או שפות אחרות בלי אימון ייעודי.

שאלות
נפוצות

האם הוא יעבוד טוב עם קבצים בעברית?

לא. המודל הוגדר ואומן עבור השפה האנגלית בלבד, ולכן קריאת מסמכים בעברית תיכשל בלי אימון מוקדם על נתונים מקומיים.

כמה זיכרון GPU מינימלי צריך כדי להריץ אותו אצלי?

בשימוש בקוונטיזציה של 4 ביט יחד עם Flash Attention 2, הוא דורש קצת פחות מתשעה גיגהבייט של זיכרון כרטיס מסך, מה שמאפשר להריץ אותו גם על חומרה צנועה יחסית.

למה התשובות שהוא מחזיר כל כך קצרות?

הגרסה הזו אומנה לתת תשובות ישירות וממוקדות ולא שיחות ארוכות. אם אתם צריכים מלל מפורט, יש להשתמש בגרסת idefics2-8b-chatty שנועדה לכך.

איך מריצים

המשקל המלא בפורמט הרגיל תופס מעל 31 גיגהבייט ודורש יותר מחמישים גיגה זיכרון כרטיס מסך, כך שאין טעם לטעון אותו בברירת המחדל. עם Flash Attention 2 ודיוק חצי, אפשר לרדת לאזור עשרים גיגה זיכרון. מי שמריץ על כרטיס ביתי פשוט יותר יכול להשתמש בקוונטיזציה של 4 ביט דרך AWQ או bitsandbytes ולהסתפק בפחות מעשרה גיגה.

אם השרת שלכם חלש מדי, המודל נתמך ישירות בתשתית TGI ויש לו נקודות קצה זמינות ב־API של Hugging Face, כך שאפשר לחסוך תחזוקה עצמית. חשוב לשים לב לגרסת ספריית transformers, כי גרסאות בין 4.41.0 ל־4.43.3 שוברות את הריצה.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="HuggingFaceM4/idefics2-8b")
print(pipe("שלום"))

הרישיון

רישיון apache-2.0 מתיר שימוש מסחרי חופשי, שינוי קוד והפצה. אתם יכולים לקחת את המשקולות, לשלב אותן בתוך שירות או מוצר מסחרי, ואין חובה לפתוח את הקוד שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗