GPT
O

one-align

קוד פתוח

q-futuremit2023-12-22

  • transformers
  • pytorch
  • mplug_owl2
  • feature-extraction
  • zero-shot-image-classification

הכלי מדרג איכות טכנית ואסתטיקה של תמונות ווידאו בסקאלה של 1 עד 5. הוא מתאים למי שרוצה למיין מדיה אוטומטית לפי איך שבני אדם שופטים אותה.

  • 2,048טוקנים בהקשר
  • 15.3 GBמשקל הקבצים
  • 86,307הורדות בחודש
  • 46לייקים

מה זה

במקום להחזיר תיאור טקסטואלי של תמונה, המודל הזה מתמקד במתן ציון מספרי לאיכות ולאסתטיקה. הוא מבוסס על ארכיטקטורת mPLUG-Owl2 עם שכבות Llama, ומאחד שלוש משימות שונות של הערכה: איכות תמונה טכנית, איכות אסתטית והערכת וידאו, תחת מודל יחיד.

התוצאות במבחנים מראות מתאם גבוה לשיפוט אנושי. במבחן AGIQA שמודד תוכן שנוצר בבינה מלאכותית הוא מגיע למתאם ספירמן של 0.801, ובמבחן האסתטיקה AVA הוא מוביל עם 0.823. המספרים האלה אומרים שהדירוג שלו עקבי מאוד ביחס לעין אנושית, גם על תמונות ומאגרים שלא נכללו באימון המקורי.

מתאים ל

  • סינון תמונות באיכות ירודה

    זיהוי תמונות מטושטשות או פגומות שהועלו על ידי משתמשים לפי ציון סף מוגדר.

  • דירוג אסתטי לגלריות

    בחירת התמונה המובילה מתוך סדרה באמצעות משימת האסתטיקה המובנית במודל.

  • בקרת איכות לתוכן גנרטיבי

    הערכת תמונות שנוצרו במודלי תמונה כדי לפסול תוצאות בעלות עיוותים טכניים.

איפה זה נופל

המודל מחזיר רק ציון מספרי בטווח של 1 עד 5, בלי שום הסבר למה התמונה קיבלה ציון נמוך, למשל טשטוש, רעש דיגיטלי או קומפוזיציה רעה. חלון ההקשר מוגבל ל־2,048 טוקנים, ואין כאן יכולת שיחה או מענה על שאלות כלליות. בנוסף, חובה לאפשר הרצת קוד מרוחק כדי להשתמש בו, מה שיוצר סיכון אבטחה שחייבים לבדוק בארגון לפני שמשלבים אותו במערכת ייצור.

שאלות
נפוצות

האם המודל יכול להסביר במילים מה פגום בתמונה?

לא. המודל מחזיר מספר עשרוני בלבד בין 1 ל־5, ללא פלט טקסטואלי שמפרט את הבעיה.

איזה זיכרון כרטיס מסך נדרש כדי להריץ אותו?

המשקל שלו הוא 15.3 גיגהבייט, ולכן בפועל צריך כרטיס מסך של 24 גיגהבייט כדי לטעון אותו בבטחה ולהריץ עיבוד.

איך מריצים

טוענים אותו ישירות דרך ספריית transformers עם גרסה 4.36.1, ומשתמשים בפונקציה מובנית שנקראת score כדי לקבל את הציון. הקבצים שוקלים 15.3 גיגהבייט בדיוק bfloat16, כך שתצטרכו כרטיס מסך עם לפחות 16 עד 24 גיגהבייט זיכרון כדי להעלות אותו בבטחה ב־float16.

הרצה מקומית דורשת הפעלה של trust_remote_code בזמן הטעינה, מה שאומר שהקוד של המודל רץ ישירות מהמאגר. אם אתם מעבדים אלפי תמונות ביום בצינור עיבוד פנימי, כדאי להרים אותו על שרת ייעודי, אבל עבור בדיקות נקודתיות המשקל והתלויות עלולים להכביד.

from transformers import pipeline

pipe = pipeline("zero-shot-image-classification", model="q-future/one-align")
print(pipe("שלום"))

הרישיון

הרישיון הוא MIT. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להפיץ אותו ולשלב אותו במוצרים סגורים, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗