GPT
C

CLIP-ViT-B-32-laion2B-s34B-b79K

קוד פתוח

laionmit2022-09-14

  • open_clip
  • pytorch
  • safetensors
  • clip
  • zero-shot-image-classification

יש כאן גם סקירה על LAION עצמו.

שחזור פתוח של CLIP שלמד על שני מיליארד תמונות וטקסטים. הוא מתאים למי שרוצה מודל קל לסיווג תמונות וחיפוש טקסט בלי לפתח מאפס ובלי תלות בשירות ענן סגור.

  • 151Mפרמטרים
  • 77טוקנים בהקשר
  • 2.3 GBמשקל הקבצים
  • 3,860,781הורדות בחודש

מה זה

מדובר במימוש של ארכיטקטורת CLIP עם ViT-B/32, שאומן באמצעות ספריית OpenCLIP על גבי תת-קבוצה אנגלית של שני מיליארד דוגמאות מתוך מאגר LAION-5B. הרעיון הבסיסי נשען על מיפוי תמונות וטקסט לאותו מרחב וקטורי, כך שאפשר להריץ סיווג תמונות ישיר לחלוטין לפי שמות קטגוריות טקסטואליות, לבצע חיפוש תמונות לפי תיאור חופשי או להשתמש בו לחישוב וקטורים משותפים.

במבחן התוצאה, הוא מציג דיוק אפס-דוגמאות של 66.6 אחוז ב־ImageNet-1k עבור top-1. המשמעות בפועל היא שהוא מזהה נכון שתי תמונות מתוך שלוש בלי שעבר אימון ספציפי על הקטגוריות האלה מראש. עבור מודל עם 151 מיליון פרמטרים בלבד, מדובר בנקודת פתיחה שימושית מאוד למיון מהיר, אבל הוא עדיין יטעה לעיתים קרובות אם תנסו להסתמך עליו בעיניים עצומות.

מתאים ל

  • סיווג תמונות לפי קטגוריות

    הוא מזהה נושאים בתמונות מתוך רשימת תוויות טקסטואליות באנגלית בלי צורך לאמן שכבת סיווג מראש.

  • מנוע חיפוש תמונות בטקסט

    הוא ממיר טקסט ותמונה לאותו מרחב וקטורי, כך שאפשר לחפש תמונות במאגר בעזרת שאילתות קצרות.

  • הנחיה למודלי יצירה

    הוא מתאים כמשקולת היזון להכוונה והערכה של מודלי יצירת תמונה ביחס לתיאור טקסטואלי נתון.

איפה זה נופל

המודל אומן אך ורק על טקסט באנגלית, ולכן כל ניסיון לשלוח אליו תיאורים בעברית או בשפות אחרות יחזיר תוצאות שגויות לחלוטין. חלון ההקשר מוגבל ל־77 טוקנים, מה שחוסם אפשרות לתיאורי תמונה ארוכים או מורכבים.

הכרטיס מדגיש שהדאטהסט היה גולמי ואינו מסונן, כך שהמודל עלול להציג הטיות בעייתיות, והמפתחים מציינים במפורש כי מעקב וזיהוי פנים נמצאים מחוץ לטווח השימוש המותר. כמו כן, הרגישות לטקסונומיה גבוהה, ושינוי קל בניסוח הקטגוריה יכול להפיל את אחוזי הדיוק בחדות.

שאלות
נפוצות

האם אפשר להשתמש בו לחיפוש תמונות בעברית?

לא באופן ישיר. המודל אומן על טקסטים באנגלית בלבד, ואינו מבין עברית. אם המערכת שלכם עובדת בעברית, תצטרכו לתרגם את השאילתות לאנגלית לפני שליחתן למודל.

האם הוא מספיק קל לריצה מקומית על לפטופ רגיל?

כן, לחלוטין. עם 151 מיליון פרמטרים ומשקל של 2.3 גיגה-בייט, הוא עובד היטב גם על מעבד רגיל בלי כרטיס מסך ייעודי, כל עוד מדובר בעיבוד של תמונות בודדות ולא באצוות ענק.

איך מריצים

בגודל של כ־151 מיליון פרמטרים ומשקל קבצים כולל של 2.3 גיגה-בייט, הדרישות שלו קלות במיוחד. הוא רץ בלי בעיה על מעבד רגיל, ובכרטיס מסך בסיסי עם 4 עד 6 גיגה זיכרון אפשר להריץ אותו בקצב גבוה מאוד בתוך שניות.

אין סיבה אמיתית לשלם על API חיצוני למשימות כאלה, כי הוא קטן מספיק כדי לשבת בתוך שרת קיים או אפילו על מחשב נייד. ההרצה נעשית ישירות דרך ספריית open_clip או דרך Hugging Face transformers, כשכל מה שצריך זה לטעון את המשקלים ולשלוח תמונות לצד רשימת טקסטים של עד 77 טוקנים.

pip install -U huggingface_hub
hf download laion/CLIP-ViT-B-32-laion2B-s34B-b79K

הרישיון

המודל שוחרר תחת רישיון MIT. הרישיון הזה מתיר שימוש מסחרי חופשי, שינוי של הקוד והמשקלים, והפצה מחדש בתוך מוצרים מסחריים ופרטיים. התנאי היחיד הוא שמירת הודעת זכויות היוצרים והרישיון המקורי בקבצי המקור של הפרויקט שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗