GPT
C

CLIP-GmP-ViT-L-14

קוד פתוח

zer0intmit2024-06-15

  • transformers
  • safetensors
  • clip
  • zero-shot-image-classification
  • endpoints_compatible

כיול מחדש של מודל הראייה והטקסט מבית OpenAI, שנועד לשפר דיוק בסיווג תמונות ולשמש כרכיב טקסט חד עבור מחוללי תמונה כמו פלוקס או סטייבל דיפיוז'ן.

  • 428Mפרמטרים
  • 11.9 GBמשקל הקבצים
  • 20,481הורדות בחודש
  • 522לייקים

מה זה

מדובר בכוונון עדין למודל המקורי של OpenAI בארכיטקטורת ViT-L-14, המשלב עיבוד תמונה וטקסט עם 428 מיליון פרמטרים. המפתח השתמש בשיטה של פרמטריזציה גיאומטרית, החלקת תוויות ומניפולציה של נוירונים ספציפיים כדי לחלץ ביצועים טובים יותר מאותו גודל מודל בדיוק, בלי להגדיל את כמות החישובים בזמן ריצה.

במבחני דיוק על מאגרי ImageNet ו־ObjectNet המודל מציג זינוק מכ־0.84 או 0.85 במקור לאזור ה־0.91. מעבר לסיווג תמונות נקי, המודל צבר פופולריות דווקא כמפענח טקסט חלופי במודלי דיפוזיה, שם הוא מקטין את הפער בין המודל הוויזואלי למלל ומאפשר למחולל לעקוב טוב יותר אחרי הוראות מורכבות וטקסט שמופיע בתוך התמונה עצמה.

מתאים ל

  • מקודד טקסט למחוללי תמונה

    מחליף את מקודד ברירת המחדל בפלוקס או SDXL לטובת הבנה מדויקת יותר של פרומפטים מורכבים.

  • סיווג תמונות ישיר

    מציג דיוק גבוה משמעותית בסיווג ללא אימון מוקדם על בסיסי נתונים רחבים מול מודל הבסיס.

  • זיהוי כיתוב בתוך תמונה

    גרסת המלל המותאמת תופסת טוב יותר נוכחות של טיפוגרפיה וטקסט בהשוואה לגרסאות קודמות.

איפה זה נופל

המאגר מציע כמה גרסאות שונות כמו TEXT ו־SMOOTH, והבחירה ביניהן לא טריוויאלית אלא תלויה באופי הפרומפטים שלכם ודורשת ניסוי וטעייה. בנוסף, גרסת הבסיס הראשונית כבר מוגדרת כנחותה על ידי היוצר, ובקיץ 2025 הוא כבר הפנה לגרסה חדשה יותר, כך שמדובר במוצר בתנועה מתמדת. המודל עדיין מבוסס על הארכיטקטורה המקורית של CLIP, ולכן סובל מהמגבלות הטבעיות שלה בהבנת יחסים מורכבים במרחב.

שאלות
נפוצות

באיזה קובץ כדאי להשתמש מתוך המאגר העמוס?

אם המטרה היא יצירת תמונות, בחרו בקובץ safetensors שמכיל רק את מקודד הטקסט. לגרסה עם דגש על מילים השתמשו בגרסת TEXT, ועבור סצנות ללא כיתוב נסו את קובץ SMOOTH.

האם המודל דורש שרת חזק כדי לבצע סיווג?

לא, גודל של 428 מיליון פרמטרים נחשב קל מאוד ביחס למודלים מודרניים. אפשר להריץ אותו להסקה מקומית על מחשב אישי עם מעבד גרפי סטנדרטי בלי שום בעיה.

איך מריצים

אתם יכולים לטעון אותו ישירות דרך ספריית transformers הרגילה של פייתון עם CLIPModel ו־CLIPProcessor, או לחבר אותו לסקריפטים של diffusers. המודל שוקל כ־11.9 גיגה בייט במאגר המלא, אך בזמן ריצה רגיל ב־float32 הוא דורש פחות משני גיגה בייט של זיכרון כרטיס מסך, כך שכל כרטיס מודרני ממוצע יריץ אותו בקלות.

אם השימוש שלכם הוא רק כחלק ממחולל תמונות כמו פלוקס, אין סיבה להוריד את כל 23 הקבצים. המפתח מציע קובצי safetensors ייעודיים שמכילים רק את מקודד הטקסט, מה שחוסך מקום ומאפשר לטעון אותם ישר לתוך ComfyUI.

from transformers import pipeline

pipe = pipeline("zero-shot-image-classification", model="zer0int/CLIP-GmP-ViT-L-14")
print(pipe("שלום"))

הרישיון

המודל משוחרר ברישיון MIT, בדיוק כמו המודל המקורי של OpenAI שעליו הוא נשען. זהו רישיון מתירני שמאפשר שימוש מסחרי מלא, שינוי של המשקולות ושילוב במוצרים סגורים, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗