GPT
L

Llama-3.2-11B-Vision-Instruct-bnb-4bit

קוד פתוח

unslothllama3.22024-09-25

  • transformers
  • safetensors
  • mllama
  • image-text-to-text
  • llama-3

גרסה מכווצת בארבעה ביטים של מודל הראייה והטקסט מבית מטא. היא נותנת שילוב של תמונות והוראות טקסט בלי לדרוש שרת יקר ומורכב.

  • 11Bפרמטרים
  • 131,072טוקנים בהקשר
  • 6.7 GBמשקל הקבצים
  • 6,225הורדות בחודש

מה זה

מדובר בגרסה שעברה קוונטיזציה בשיטת bitsandbytes לדיוק של 4 ביט, שנבנתה ישירות על המודל הרב-מודאלי של מטא בנפח 11 מיליארד פרמטרים. המטרה כאן היא לאפשר ניתוח תמונות והבנת טקסט יחד, תוך שמירה על ביצועים סבירים ומשקל קובץ נמוך שמסתכם ב־6.7 גיגה בייט בלבד.

המודל משתמש בארכיטקטורת MllamaForConditionalGeneration כדי לקבל תמונה והוראה כתובה, ולהחזיר תשובה טקסטואלית בהתאם. הוא תומך בחלון הקשר עצום של 131,072 טוקנים, מה שמאפשר להעמיס עליו תיאורים ארוכים, מסמכים מורכבים או היסטוריית שיחה מפורטת לצד הקלט הוויזואלי בלי להיחנק באמצע.

היתרון המרכזי של הגרסה של Unsloth הוא החיסכון הניכר במשאבים. לפי הנתונים שלהם, העבודה עם הגרסה הזו מציגה חיסכון של 60 אחוז בשימוש בזיכרון והאצה של פי שניים בריצה לעומת המשקל המלא, מה שמאפשר להריץ אימון והסקה גם על כרטיסים גרפיים פשוטים יחסית בלי לאבד את היכולות הבסיסיות של המודל המקורי.

מתאים ל

  • ניתוח תמונות באנגלית

    קריאת תוכן מתמונות ומענה על שאלות בשפות הנתמכות רשמית, ישירות על חומרה מקומית צנועה.

  • אימון זול על מידע ויזואלי

    ביצוע fine-tuning יעיל שדורש 60 אחוז פחות זיכרון על כרטיס גרפי פשוט כמו T4.

  • שיחה מרובת הקשר עם תמונה

    ניצול חלון של 131 אלף טוקנים לשיחות ארוכות ומעקב מתמשך סביב תמונות ומסמכים.

איפה זה נופל

התמיכה הרשמית של המודל כוללת אנגלית ושבע שפות נוספות בלבד, כמו גרמנית, צרפתית וספרדית. עברית לא נמצאת ברשימת השפות הנתמכות, ולמרות שהוא נחשף ליותר שפות באימון, לא הייתי בונה עליו לניתוח טקסט בעברית מתוך תמונות בלי בדיקה מעמיקה מראש. בנוסף, מדובר במודל סטטי שאומן על מידע אופליין בלבד.

אותה משפחה

Llama-3.2-11B-Vision יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל מתאים לעבודה עם מסמכים ותמונות בעברית?

לא באופן רשמי. מטא הגדירה תמיכה בשמונה שפות ספציפיות שלא כוללות עברית, ולכן צריך לבחון אותו היטב לפני שמשלבים אותו במוצר שמיועד לטקסט עברי.

איזה כרטיס מסך צריך בשביל להריץ אותו מקומית?

המודל שוקל 6.7 גיגה בייט בלבד לאחר כיווץ ל־4 ביט. כרטיס מסך בסיסי עם 16 גיגה בייט של VRAM, כמו ה־Tesla T4 שזמין בחינם בקולאב, מספיק בהחלט להרצה ולאימון.

מה נותנת הגרסה הזו על פני המודל הרגיל של מטא?

היא מציעה דחיסה שמורידה משמעותית את צריכת הזיכרון ומאיצה את האימון פי שניים, מה שמאפשר לעבוד איתו בלי להשקיע בשרתים כבדים ויקרים.

איך מריצים

בזכות הדחיסה לארבעה ביטים ומשקל של 6.7 גיגה בייט, המודל הזה רץ בצורה חלקה על כרטיס בודד דוגמת Tesla T4 החינמי של גוגל קולאב, עם ספריית transformers וסביבת Unsloth. אם אתם מחפשים לאמן אותו על הנתונים שלכם, החיסכון בזיכרון מאפשר לעשות fine-tuning בלי לקרוס מחוסר מקום ב־VRAM.

אם כל מה שאתם צריכים זה לנתח כמה תמונות בודדות פעם ביום, פנייה ל־API חיצוני תחסוך לכם את הצורך לתחזק סביבת פייתון ותלויות מקומיות. לעומת זאת, כשיש דרישה לפרטיות, עבודה מקומית ללא עלויות קריאה שוטפות או התאמה אישית של המשקלים, הגרסה הזו נותנת פתרון ישיר וזול לחומרה עצמאית.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="unsloth/Llama-3.2-11B-Vision-Instruct-bnb-4bit")
print(pipe("שלום"))

הרישיון

הרישיון הוא רישיון הקהילה הרשמי של Llama 3.2 מבית מטא. הוא מאפשר שימוש מסחרי חופשי למרבית המפתחים והעסקים, כל עוד עומדים במדיניות השימוש המקובל של מטא ובתנאי ההפצה המקוריים שצורפו למודל.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗