GPT
P

plip

קוד פתוח

vinidרישיון לא דווח2023-03-04

  • transformers
  • pytorch
  • clip
  • zero-shot-image-classification
  • endpoints_compatible

התאמה של ארכיטקטורת CLIP לסיווג תמונות ללא אימון מוקדם, שמתבססת על מידע מטוויטר. הוא מתאים בעיקר לחוקרים שרוצים לבדוק התנהגות של מודלי ראייה ממוחשבת מול טקסט באנגלית.

  • 77טוקנים בהקשר
  • 579 MBמשקל הקבצים
  • 53,953הורדות בחודש
  • 60לייקים

מה זה

מדובר במודל שמבוסס על CLIPModel ומיועד לסיווג תמונות בשיטת zero-shot, שבה אתם מגדירים תוויות טקסט חופשיות והוא מחשב התאמה בינן לבין התמונה. המודל שוקל 579 מגה בייט בלבד, כך שמדובר במשקל קל מאוד יחסית למודלי ראייה מודרניים, והוא עובד עם חלון הקשר קצר של 77 טוקנים לטקסט.

היוצר vinid פרסם אותו במקור למטרות מחקר אקדמי. לפי התיעוד שלו, הוא נועד לעזור לחוקרי בינה מלאכותית לבחון הכללה, עמידות, הטיות ומגבלות של מודלי ראייה ממוחשבת, במיוחד סביב טקסונומיות שונות של מחלקות.

הכרטיס כולל הבהרות משפטיות לגבי שימוש בנתונים שמקורם בטוויטר, כולל הגבלות חלוקה מחדש שמסתמכות רק על מזהי ציוצים. אין בעמוד נתוני מדידה מספריים או מבחני ביצועים שמראים דיוק מול מודלים אחרים, כך שקשה לדעת מראש איך הוא יתפקד מחוץ למעבדה.

מתאים ל

  • מחקר הטיות בראייה ממוחשבת

    בדיקה של אופן ההתמודדות של ארכיטקטורת CLIP עם סיווג תמונות וטקסונומיות שונות.

  • סיווג תמונות באנגלית במעבדה

    בדיקת התאמה בין תמונות לטקסט קצר באנגלית בסביבת ניסוי סגורה וללא צורך באימון מראש.

  • בדיקות קונספט מקומיות

    הערכת zero-shot על חומרה ביתית פשוטה בזכות גודל קובץ של 579 מגה בייט בלבד.

איפה זה נופל

הכרטיס מצהיר בבירור שכל פריסה של המודל, מסחרית או לא, נמצאת מחוץ לטווח השימוש המיועד. מודלים מסוג CLIP רגישים מאוד לשינויים בניסוח הטקסונומיה של המחלקות, ומשתנים לרעה לפי הניסוח שתבחרו. היוצרים מדגישים שהוא אומן ונבדק רק באנגלית, כך שאין מה לנסות להזין לו תוויות בעברית. בנוסף, יש אזהרה מפורשת שהתוצאות אינן מהוות ייעוץ רפואי ואין להסתמך עליהן בתחום זה.

שאלות
נפוצות

האם אפשר להשתמש במודל למיון תמונות עם תוויות בעברית?

לא. הכרטיס מציין במפורש שהמודל לא אומן ולא נבדק בשום שפה מלבד אנגלית, ולכן השימוש בו מוגבל לאנגלית בלבד.

האם כדאי לשלב אותו באפליקציה מסחרית?

ממש לא. מעבר לכך שלא צוין רישיון שימוש, היוצרים כתבו בפירוש שכל פריסה מעשית של המודל נמצאת מחוץ לטווח המותר, מחשש לביצועים לא יציבים והטיות.

איזה סוג מידע מותר להעביר הלאה אם משתמשים במודל הזה?

לפי תנאי השימוש של טוויטר שמופיעים בתיעוד, מותר להפיץ מחדש אך ורק מזהי ציוצים (Tweet IDs) ולא את תוכן הציוצים עצמם.

איך מריצים

המשקל הכולל של הקבצים עומד על 579 מגה בייט, כך שאין שום צורך בחומרה כבדה או בשרת ייעודי יקר. אפשר להריץ אותו ישירות דרך ספריית transformers של פייתון על כרטיס מסך בסיסי או אפילו על מעבד רגיל, בדיוק float32 בלי להסתבך עם קוונטיזציה.

אין סיבה אמיתית לחפש פה שירות ענן או API חיצוני. בגלל הגודל המזערי שלו, הרבה יותר פשוט, זול ומהיר להוריד את הקבצים ולהריץ את ההסקה מקומית במכונה שלכם.

from transformers import pipeline

pipe = pipeline("zero-shot-image-classification", model="vinid/plip")
print(pipe("שלום"))

הקבצים

8 קבצים במאגר, 579 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

בעמוד המודל לא דווח רישיון כלל. מבחינה משפטית, היעדר רישיון אומר שאין לכם הרשאה מפורשת להשתמש בו, להפיץ אותו או לשלב אותו במוצר מסחרי. כל שימוש מעבר למחקר פרטי עלול לחשוף אתכם לסיכון של הפרת זכויות יוצרים.

הרישיון המלא בעמוד המודל ↗