GPT
F

fashion-clip

קוד פתוח

patrickjohncyhmit2023-02-21

  • transformers
  • pytorch
  • onnx
  • safetensors
  • clip

התאמה ייעודית של קליפ לתחום האופנה, עם דיוק משופר בתיוג וחיפוש פריטי לבוש. הוא פותר את הקושי של מודלים כלליים בזיהוי גזרות, מותגים וסגנונות ספציפיים.

  • 151Mפרמטרים
  • 77טוקנים בהקשר
  • 1.7 GBמשקל הקבצים
  • 2,146,617הורדות בחודש

מה זה

המודל לוקח את ארכיטקטורת ViT-B/32 ומאמן אותה מחדש על כ־800 אלף מוצרים מאתר Farfetch, שכוללים מעל 3,000 מותגים. במקום להסתפק בהבנה כללית של מה זה חולצה או נעל, הוא לומד לחבר בין שפה אופנתית מקצועית כמו שרוולים ארוכים או פסים לבין התמונה עצמה.

גרסה 2.0 נבנתה על בסיס משקלים של LAION במקום הבסיס המקורי של OpenAI, מה שהקפיץ את התוצאות בכל המבחנים. במדד ה־F1 הוא עולה מ־0.66 ל־0.83 על FMNIST, ומ־0.45 ל־0.62 על DEEP. המשמעות בפועל היא פחות פספוסים בסיווג ללא אימון מוקדם, במיוחד בפרטים הקטנים של הבגד.

מתאים ל

  • חיפוש טקסטואלי בחנויות

    מאתר בגדים לפי תיאורים כמו חולצת פסים או שמלת וינטג' ישירות מתוך קטלוג תמונות.

  • תיוג מוצרים אוטומטי

    מסווג פריטים חדשים לקטגוריות ולמותגים ללא צורך באימון מודל ייעודי לכל קטגוריה.

  • סינון קטלוג לפי גזרה

    מזהה מאפיינים ויזואליים דקים כמו אורך שרוול או סוג צווארון מתוך תמונת מוצר נקייה.

איפה זה נופל

האימון נעשה על צילומי סטודיו קלאסיים של מוצרים על רקע לבן וללא בני אדם. אם תזרקו עליו תמונות משתמשים מטושטשות, סלפי מול מראה או בגד שנלבש ברחוב, הדיוק ייחתך בצורה מורגשת.

בנוסף, הטקסטים באימון היו תיאורים מפורטים, ולכן שאילתות קצרות של מילה אחת עובדות פחות טוב מטקסט עשיר. המודל גם יורש הטיות מגדריות מובנות מהדאטה, תומך באנגלית בלבד, וחלון הטקסט שלו מוגבל ל־77 טוקנים.

שאלות
נפוצות

האם הוא מבין חיפושים בעברית?

לא. המודל אומן על טקסטים באנגלית בלבד. אם האתר שלכם בעברית, תצטרכו לתרגם את השאילתות של המשתמשים לאנגלית לפני שמעבירים אותן למודל.

איך הוא מתמודד עם תמונות של אנשים לובשים את הבגד?

פחות טוב. נתוני האימון כללו רק פריטים מבודדים על רקע לבן ללא אנשים. בתמונות מהחיים האמיתיים עם רקע מורכב הביצועים יורדים וצריך לבדוק אותו היטב על הדאטה שלכם.

איך מריצים

בגודל של 151 מיליון פרמטרים ומשקל קבצים של 1.7 גיגהבייט, אפשר להריץ אותו בקלות על מעבד רגיל או על כרטיס מסך בסיסי מאוד, אפילו עם 4 גיגהבייט זיכרון. טוענים אותו ישירות דרך ספריית transformers של פייתון בלי שום התקנות מורכבות.

אין סיבה אמיתית לשלם על API חיצוני בשביל מודל קל כזה. אלא אם אתם צריכים לאנדקס מיליוני תמונות בדקה, שרת עצמאי קטן יסגור לכם את הפינה בעלות נמוכה מאוד ובלי תלות בצד שלישי.

from transformers import pipeline

pipe = pipeline("zero-shot-image-classification", model="patrickjohncyh/fashion-clip")
print(pipe("שלום"))

הרישיון

רישיון MIT פתוח לגמרי ונוח מאוד. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהטמיע אותו במוצר שלכם בלי תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗