GPT
P

PickScore_v1

קוד פתוח

yuvalkirstainרישיון לא דווח2023-04-24

  • transformers
  • pytorch
  • safetensors
  • clip
  • zero-shot-image-classification

פונקציית ניקוד שמדרגת תמונות שנוצרו מטקסט לפי העדפות אנושיות אמיתיות. המודל מקבל פרומפט ותמונה, ומחזיר ציון התאמה ואיכות.

  • 986Mפרמטרים
  • 77טוקנים בהקשר
  • 7.4 GBמשקל הקבצים
  • 262,437הורדות בחודש

מה זה

מדובר במודל שמבוסס על ארכיטקטורת CLIP-H ועבר אימון על בסיס נתונים בשם Pick-a-Pic, שמכיל העדפות של אנשים על תמונות שנוצרו מטקסט. המטרה שלו פשוטה: לחזות איזו תמונה משתמש אנושי יעדיף מתוך כמה אפשרויות שנוצרו עבור אותו פרומפט, או לתת ציון בודד להתאמה בין טקסט לתוצאה.

הוא שונה ממודלי CLIP רגילים בכך שהוא לא רק בודק דמיון סמנטי כללי בין טקסט לתמונה, אלא ממש אומן על החלטות של בני אדם שבחרו תוצאה אחת על פני אחרת. זה הופך אותו לכלי מתאים לבדיקת איכות של מודלי יצירת תמונה, לסינון תוצאות בזמן אמת או לדירוג אוטומטי של כמה פלטים במקביל.

מתאים ל

  • דירוג תוצאות של מחוללי תמונה

    מייצרים ארבע תמונות שונות לאותו פרומפט ובוחרים אוטומטית את זו שמקבלת את הציון הגבוה.

  • בדיקת איכות למודלים

    הרצה על בסיס נתונים שלם כדי לבדוק אם גרסה חדשה של מחולל תמונות מייצרת פלטים עדיפים.

  • סינון תוצאות גרועות

    הורדת תמונות שלא מתאימות לתיאור המקורי או שקיבלו ציון נמוך לפני שהן מוצגות למשתמש קצה.

איפה זה נופל

מגבלת הקלט הבולטת ביותר היא חלון הקשר של 77 טוקנים בלבד, שמגיע מהבסיס של CLIP. פרומפטים ארוכים, מפורטים או מורכבים במיוחד פשוט ייחתכו ולא יקבלו ניקוד שמתחשב בכל הטקסט. בנוסף, כרטיס המודל חלקי מאוד ולא כולל פירוט על הטיות אפשריות, שפות נתמכות מעבר לאנגלית או תהליך האימון המדויק.

שאלות
נפוצות

האם המודל מייצר תמונות בעצמו?

לא. הוא לא מחולל תמונות אלא פונקציית ניקוד בלבד, שמקבלת תמונה מוכנה וטקסט ופולטת מספר שמייצג את האיכות וההתאמה.

האם אפשר להשתמש בו ישירות מתוך ספריית transformers?

כן, המודל משתמש בארכיטקטורת CLIPModel הסטנדרטית ונתמך ישירות בספרייה ללא צורך בהתקנות מיוחדות.

איך מריצים

המודל שוקל 7.4 גיגה בייט בפורמט float32 ורץ דרך ספריית transformers. מדובר בקרוב למיליארד פרמטרים, כך שכדי להריץ אותו מקומית ובמהירות סבירה תצטרכו כרטיס מסך עם מספיק זיכרון להחזיק משקל כזה, או להמיר אותו למספרים קטנים יותר אם אתם מוגבלים בחומרה.

אם אתם רק רוצים לראות איך הוא עובד בלי להוריד את כל הקבצים ולהרים סביבה, היוצרים העלו דמו ב־Huggingface Spaces שמאפשר לבדוק את הניקוד ישירות דרך הדפדפן.

from transformers import pipeline

pipe = pipeline("zero-shot-image-classification", model="yuvalkirstain/PickScore_v1")
print(pipe("שלום"))

הרישיון

היוצר לא דיווח על רישיון בעמוד המודל. מבחינה משפטית, היעדר רישיון אומר שאין לכם הרשאה מפורשת להשתמש במשקלים שלו במוצר מסחרי, וחובה לפנות למחברים או לחפש הבהרה במאגר הקוד לפני שמכניסים אותו למערכת שלכם.

הרישיון המלא בעמוד המודל ↗