GPT
L

Llama-3.2V-11B-cot

קוד פתוח

Xkevapache-2.02024-11-19

  • transformers
  • safetensors
  • mllama
  • image-text-to-text
  • llava

גרסה מכווננת של מודל הראייה של מטא, שמאלצת את הרשת לחשוב בשלבים לפני מתן תשובה. המטרה כאן היא חילוץ מסקנות הגיוניות מתמונות מורכבות במקום ניחוש מהיר.

  • 11Bפרמטרים
  • 131,072טוקנים בהקשר
  • 39.8 GBמשקל הקבצים
  • 414הורדות בחודש

מה זה

הבסיס פה הוא מודל הראייה 11B של מטא, שעבר כוונון ייעודי על סט נתונים של מאה אלף דוגמאות חשיבה כדי לייצר שרשרת הסקה מסודרת. במקום לקפוץ ישר לפלט סופי, הוא מפרט תהליך לוגי ורק אז סוגר את התשובה בתוך תגיות ייעודיות.

במבחני הביצועים הוא חזק במיוחד בניתוח דיאגרמות עם ציון 85.7 במדד AI2D, ומגיע ל־75 במבחן MMBench הכללי. מצד שני, במבחן Hallusion הוא מקבל רק 47.8, וזה אומר שבמשימות שדורשות הבחנה מדויקת בפרטים קטנים בלי להמציא דברים, הוא עדיין נוטה להזיות ברמה שאי אפשר להתעלם ממנה.

מתאים ל

  • פיענוח דיאגרמות ותרשימים

    הציון הגבוה במבחן ייעודי לתרשימים הופך אותו ליעיל בהבנת גרפים טכניים והסבר השלבים שמוצגים בהם.

  • פתרון בעיות חזותיות

    חשיבה צעד אחר צעד מאפשרת לו לפרק שאלות מורכבות מתמונות לפני קביעת המסקנה.

  • חילוץ נתונים מובנה מתמונה

    התשובה הסופית נתחמת בתגיות קבועות, מה שמקל על שליפת הערך הרצוי ישירות לקוד בלי לכלוך מסביב.

איפה זה נופל

המפתחים מודים בגלוי שהיכולת שלו לעקוב אחרי הוראות מורכבות עדיין נמוכה משמעותית מזו של מודלים מובילים בתעשייה. בנוסף, חציון של 47.8 במבחן ההזיות מראה שהוא עלול לבנות שרשרת היגיון שלמה שמבוססת על פרט שהוא פשוט המציא מתוך התמונה. מי שבונה עליו חייב לבדוק ידנית שהוא לא מייצר תשובות שנשמעות משכנעות אך שגויות לחלוטין.

שאלות
נפוצות

האם המודל תומך בשפה העברית?

הוא אומן ומתועד רשמית באנגלית בלבד. אפשר לנסות לשלוח לו שאלות בעברית כי מודל הבסיס מכיר מעט, אבל יכולת ההסקה המורכבת תישחק ותרד משמעותית.

למה התשובות שלו ארוכות בהרבה ממודל ראייה רגיל?

זה מכוון לגמרי. הוא אומן לפלוט קודם את כל שלבי ההיגיון כדי להגיע לתשובה מדויקת, ולכן צריך לחתוך מהפלט רק את מה שנמצא בין תגיות המסקנה.

איך מריצים

המשקל הכולל של הקבצים מגיע לכמעט ארבעים גיגה בייט בפורמט float32 המקורי. כדי להריץ אותו בלי שגיאות זיכרון תצטרכו כרטיס עם לפחות 48 גיגה בייט זיכרון גרפי, אלא אם תמירו את המשקלים לחצי דיוק או תבצעו קוונטיזציה לחומרה צנועה יותר.

ההרצה עצמה מתבצעת ישירות דרך ספריית transformers עם קוד ההסקה הרגיל של מודלי הראייה ממשפחת לאמה 3.2. בגלל שהוא כותב הסבר שלם לפני התשובה, חובה להגדיר לו מגבלת טוקנים חדשים נדיבה של 2048, ולחלץ את התוצאה הסופית שמופיעה בין התגיות כדי לקבל ערך נקי לפרודקשן.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="Xkev/Llama-3.2V-11B-cot")
print(pipe("שלום"))

הרישיון

החוקר סימן את הפרויקט תחת רישיון אפאצ׳י 2.0 שמאפשר שימוש מסחרי חופשי, אבל המודל מבוסס על משקלים של מטא. לכן אתם כפופים לחלוטין לתנאי הקהילה ולמדיניות השימוש של לאמה 3.2, ולא תוכלו להתעלם מהמגבלות של מטא רק בגלל התגית במאגר.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗