GPT
I

Idefics3-8B-Llama3

קוד פתוח

HuggingFaceM4apache-2.02024-08-05

  • transformers
  • safetensors
  • idefics3
  • image-text-to-text
  • multimodal

מודל פתוח מבית האגינג פייס שמשלב טקסט ותמונות על בסיס לאמה 3.1. הוא מצטיין בעיבוד מסמכים ובקריאת טקסט מתוך תמונות בגודל שמתאים לשרת בודד.

  • 8.5Bפרמטרים
  • 131,072טוקנים בהקשר
  • 15.8 GBמשקל הקבצים
  • 85,123הורדות בחודש

מה זה

מדובר במודל שמשלב בין מקודד התמונות SigLIP של גוגל לבין מודל השפה Llama 3.1 8B Instruct. הוא מקבל רצפים מעורבבים של טקסט ותמונות ומחזיר טקסט, כך שאפשר לשאול אותו שאלות על מסמכים, לקבל תיאורי תמונה או להריץ אותו כמודל שפה רגיל לגמרי. ארכיטקטורת החלוקה שלו חותכת כל תמונה לחלקים קטנים וממירה אותה לטוקנים ויזואליים בצורה יעילה.

הקפיצה המשמעותית שלו לעומת הגרסה הקודמת נמצאת בהבנת מסמכים. במבחן DocVQA הוא קופץ מציון של 74 לציון של 87.7, שזה שיפור מורגש ביכולת לחלץ מידע מדויק מטבלאות ודוחות סרוקים. גם במבחני חשיבה מתמטית מבוססת תמונה כמו MathVista הוא רושם עלייה יפה, אם כי במשימות זיהוי טקסט כלליות הפער מורגש פחות.

מתאים ל

  • חילוץ נתונים ממסמכים

    שליפת מידע מדוחות וטפסים סרוקים באנגלית, בזכות זינוק של מעל עשר נקודות במבחן DocVQA.

  • מענה על שאלות מתמונות

    ניתוח כמה תמונות ברצף יחד עם טקסט, כשהמשתמש שואל שאלות מורכבות על מה שמופיע בהן.

  • בסיס לאימון מותאם

    נקודת מוצא נוחה למי שרוצה לאמן מודל ראייה קל יחסית על סט נתונים ארגוני פרטי.

איפה זה נופל

המודל עבר אימון עם הנחיה בלבד וללא שלב של יישור בעזרת משוב אנושי. בגלל זה הוא נוטה לתת תשובות קצרות מדי או להתפזר, ולפעמים צריך לכוון אותו עם פרומפטים שמאלצים מחשבה שלב אחר שלב כדי להוציא תוצאה טובה.

היוצרים מבהירים במפורש שהוא לא מתאים לקבלת החלטות קריטיות או משימות שדורשות עובדות מדויקות לחלוטין בלי בדיקה אנושית. המודל אומן על אנגלית בלבד, כך שלא הייתי בונה עליו לקריאת מסמכים או מענה בעברית בלי אימון ייעודי מראש, והוא לא יודע לייצר תמונות כלל.

שאלות
נפוצות

האם הוא מסוגל לקרוא מסמכים בעברית?

הכרטיס מצהיר על תמיכה באנגלית בלבד. מודל הבסיס של לאמה מכיל מעט עברית, אבל רכיב הראייה אומן על נתונים באנגלית, לכן אל תצפו לחילוץ אמין של טקסט עברי מתמונות.

איך אפשר לשפר את התשובות שלו אם הוא עונה קצר מדי?

היוצרים ממליצים להוסיף תחילית לתשובה של העוזר, למשל בקשה לפתור את הבעיה צעד אחר צעד. זה מחפה על היעדר אימון יישור עם בני אדם.

האם אפשר להריץ אותו על מחשב אישי רגיל?

זה תלוי בכרטיס המסך. צריך כרטיס עם לפחות 16 עד 24 גיגה בייט זיכרון פנימי כדי לטעון אותו, כך שמעבד רגיל או מחשב נייד ממוצע לא יספיקו לזה.

איך מריצים

המשקל הכולל של הקבצים עומד על 15.8 גיגה בייט. כדי להריץ אותו בהסקה צריך כרטיס מסך של לפחות 24 גיגה בייט זיכרון, כמו RTX 3090 או A10, בטעינה של bfloat16 עם ספריית transformers גרסה 4.46 ומעלה. אם יש לחץ על הזיכרון, אפשר לשלוט ברזולוציית התמונות שהמעבד חותך ולהוריד את כמות הטוקנים הוויזואליים.

אם אין לכם כרטיס כזה זמין או שאתם לא רוצים לתחזק שרת ייעודי שעולה לא מעט כסף בחודש, שווה להשתמש בנקודת קצה מנוהלת של ספק ענן. הרצה עצמית שווה את זה רק אם המידע בתמונות רגיש ואי אפשר להוציא אותו החוצה, או אם יש נפח קריאות קבוע שמצדיק שרת דלוק.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="HuggingFaceM4/Idefics3-8B-Llama3")
print(pipe("שלום"))

הרישיון

הוא מופץ תחת רישיון אפאצ'י 2.0 המלא. זה אומר שמותר להשתמש בו לצרכים מסחריים, לשנות את הקוד שלו, לאמן אותו מחדש ולהטמיע אותו במוצרים סגורים בלי לשלם תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗