GPT
U

uform-gen2-dpo

קוד פתוח

unum-cloudapache-2.02024-03-27

  • transformers
  • safetensors
  • vlm
  • feature-extraction
  • image-captioning

מודל ראייה ושפה קטן במיוחד שנועד לתיאור תמונות ומענה על שאלות ויזואליות. הוא עבר כוונון מבוסס העדפות אנושיות, ולכן התשובות שלו עקביות יותר ממה שמצפים ממשקל כזה.

  • 1.3Bפרמטרים
  • 4.8 GBמשקל הקבצים
  • 4,040הורדות בחודש
  • 46לייקים

מה זה

הארכיטקטורה מחברת בין רכיב ראייה מסוג ViT לבין מודל שפה זעיר, Qwen1.5 בנפח חצי מיליארד פרמטרים. החיבור הזה מביא את סך הפרמטרים לאזור ה־1.3 מיליארד בלבד, עם משקל קבצים כולל של 4.8 ג'יגה בייט בפורמט float32 המקורי.

האימון כלל שלב אופטימיזציה ישירה על העדפות ממשתמשים דרך מאגרי VLFeedback ו־LLaVA. במבחני MME רואים זינוק מורגש ביכולות התפיסה מול הגרסה הבסיסית, בעיקר בזיהוי צבעים, ספירת עצמים וקביעת קיום של פרטים בתמונה. יחד עם זאת, ביכולות היסק טהור כמו חישוב מספרי או היגיון בריא, אין כאן קפיצת מדרגה אמיתית.

מתאים ל

  • תיאור תמונות אוטומטי

    יצירת כתוביות מהירות לתמונות באנגלית עבור אינדוקס, חיפוש פנימי או הנגשה בסיסית של אתרי תוכן.

  • בדיקת נוכחות של עצמים

    מענה על שאלות כן ולא לגבי קיום וספירה של פריטים פשוטים בתוך תמונה בלי צורך במודל ענק.

  • צ'אט ויזואלי במכשיר קצה

    שיחה פשוטה סביב תמונה בסביבות דלות משאבים שבהן אי אפשר להחזיק מודלי ענק של עשרות מיליארדי פרמטרים.

איפה זה נופל

המודל מוגבל לשפה האנגלית בלבד, ואין לו תמיכה רשמית בעברית. בנוסף, המבחנים מראים תוצאות חלשות מאוד בקריאת טקסט מתמונה, זיהוי מיקום ופתרון חישובים מספריים, שם הציון עומד על 50 בלבד. לא הייתי בונה עליו לחילוץ מידע ממסמכים או לפענוח שלטים מורכבים.

שאלות
נפוצות

האם המודל מבין ושואל בעברית?

לא. לפי נתוני המודל והאימון, השפה הנתמכת היחידה היא אנגלית. שליחת הנחיות בעברית תוביל לפלט שגוי או לג'יבריש.

למה יש צורך בסימון trust remote code בהרצה?

הארכיטקטורה מחברת בין שני רכיבים שונים ומחייבת קוד מותאם אישית שאינו מובנה באופן מלא בספריית המקור. הקוד יורד מהמאגר עצמו בזמן הטעינה.

איך מריצים

טעינת המודל מתבצעת ישירות דרך ספריית transformers הרגילה, אבל דורשת הפעלת trust_remote_code כדי להריץ את קוד הארכיטקטורה הייעודית שנשמר במאגר. כל התהליך דורש מודל, מעבד קלט ייעודי ופונקציית יצירת טקסט קצרה.

בזכות המשקל הקל אפשר להריץ אותו בלי בעיה על מעבדים גרפיים פשוטים או אפילו על מעבד רגיל של שרת מקומי. אם המטרה היא רק תיאור בסיסי של אלפי תמונות בשעה בלי לשלם על קריאות רשת חיצוניות, הרצה עצמית כאן חסכונית ומהירה מאוד.

from transformers import pipeline

pipe = pipeline("image-to-text", model="unum-cloud/uform-gen2-dpo")
print(pipe("שלום"))

הרישיון

הפרויקט מופץ ברישיון apache-2.0 המלא. אפשר להשתמש בו בחופשיות למוצרים מסחריים, לשנות את הקוד ולהפיץ אותו, כל עוד שומרים על הודעות זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗