GPT
F

fuyu-8b

קוד פתוח

adeptcc-by-nc-4.02023-10-17

  • transformers
  • safetensors
  • fuyu
  • image-text-to-text
  • endpoints_compatible

adept עומדים גם מאחורי Twitter, ויש עליו סקירה כאן.

מודל מולטימודלי של 9.4 מיליארד פרמטרים שמזין תמונות ישירות לטרנספורמר בלי מקודד תמונה נפרד. הוא נבנה לסוכנים דיגיטליים וקריאת מסכים ברזולוציות משתנות במהירות גבוהה.

  • 9.4Bפרמטרים
  • 16,384טוקנים בהקשר
  • 17.5 GBמשקל הקבצים
  • 21,324הורדות בחודש

מה זה

במקום להשתמש במקודד תמונה ייעודי כמו רוב המודלים המולטימודליים, פויו לוקח חלקי תמונה ומקרין אותם לינארית ישירות לשכבה הראשונה של הטרנספורמר. המבנה הזה מאפשר לו לקבל תמונות בכל רזולוציה בלי שלבי אימון נפרדים לגדלים שונים, כשהוא מתייחס לטוקנים של תמונה ממש כמו רצף טקסט רגיל.

המטרה המקורית שלו היא הבנת ממשקי משתמש, דיאגרמות וגרפים עבור סוכנים אוטונומיים. במבחני ביצועים סטנדרטיים הוא מגיע לתוצאה של 74.2 ב־VQAv2 ו־64.5 ב־AI2D, מה שמציב אותו קרוב למודלים ייעודיים לגודל הזה, אך נמוך ממודלים גדולים יותר כמו פאלי-אקס.

מתאים ל

  • סוכנים דיגיטליים

    הבנת צילומי מסך ומיקום אלמנטים גרפיים בממשקי תוכנה לצורך אוטומציה.

  • ניתוח גרפים ותרשימים

    מענה על שאלות מתוך דיאגרמות ואינפוגרפיקות ברזולוציה גמישה.

  • מחקר ארכיטקטורות ראייה

    בדיקת ביצועים של מודלים מולטימודליים ללא מקודד תמונה ייעודי.

איפה זה נופל

זהו מודל בסיס לא מכויל. היוצרים מבהירים במפורש שהוא לא כולל שכבות סינון, עיבוד פוסט או התאמה לצ'אט, ולכן הוא נוטה לפלוט מידע שגוי ולא עובדתי על אנשים ואירועים. זיהוי פנים וייצוג אנשים לוקה בחסר, ובשביל שיחות טבעיות או תיאורים מפורטים חייבים לבצע לו כיוונון עדין.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה כמו שהוא עבור בוט שירות?

לא. מדובר במודל בסיס שלא עבר התאמה לשיחה מול בני אדם. כדי לקבל תשובות עקביות ושימושיות בצ'אט תצטרכו לאמן אותו קודם על דוגמאות ייעודיות.

איך המודל מתמודד עם תמונות ברזולוציה לא סטנדרטית?

הוא מחלק את התמונה למקטעים ומזין אותם ברצף עם תו מיוחד שמסמן שבירת שורה. בזכות זה אין צורך לחתוך או לעוות תמונות מוארכות כמו דפי אינטרנט.

איך מריצים

המשקלים תופסים 17.5 ג'יגה בייט בפורמט bfloat16 על פני 17 קבצים. כדי להריץ אותו דרך ספריית transformers של פייתון תצטרכו כרטיס מסך עם לפחות 24 ג'יגה בייט של זיכרון וידאו, למשל RTX 3090 או A10, במיוחד אם תרצו לנצל את חלון ההקשר המלא שמגיע ל־16,384 טוקנים.

היוצרים מציינים זמני תגובה של פחות מ־100 מילישניות לתמונות גדולות. אם אין לכם חומרה ייעודית כזו בענן או מקומית, עדיף להשתמש בפתרון מנוהל, שכן הרצה על מעבד רגיל תהיה איטית מדי לשימוש מעשי.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="adept/fuyu-8b")
print(pipe("שלום"))

הרישיון

המודל שוחרר ברישיון cc-by-nc-4.0. המשמעות פשוטה: מותר להשתמש בו אך ורק למחקר, בדיקות וניסויים פנימיים. חל איסור מוחלט לשלב אותו במוצר מסחרי, למכור גישה אליו או להפיק ממנו רווח כספי ישיר.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗