GPT
L

LLM2CLIP-Openai-L-14-336

קוד פתוח

microsoftapache-2.02024-11-07

  • safetensors
  • clip
  • CLIP
  • LLM2CLIP
  • zero-shot-classification

microsoft עומדים גם מאחורי Sho, ויש עליו סקירה כאן.

גרסה מאומנת מחדש של מקודד התמונה של CLIP, שנעזרה במודל שפה גדול כדי להבין טקסטים ארוכים ומורכבים יותר. מתאים למי שצריך חיפוש תמונות שמסתמך על תיאורים מפורטים ולא על תגיות קצרות.

  • 579Mפרמטרים
  • 2.2 GBמשקל הקבצים
  • 17,690הורדות בחודש
  • 45לייקים

מה זה

מיקרוסופט לקחו כאן את הארכיטקטורה של CLIP הוותיק מבית OpenAI, ברזולוציה של 336 פיקסלים, ואימנו אותה מול מודל שפה גדול ששימש כמורה. ב־CLIP המקורי, מקודד הטקסט מוגבל מאוד ומתקשה להתמודד עם תיאורים ארוכים או תחביר עשיר. בגישה הזו, חילצו ייצוגים עמוקים יותר ממודל השפה והשתמשו בהם כדי לאמן את מקודד התמונה להבחין בפרטים עדינים בהרבה.

התוצאה היא משקל חזותי שמתאים לשליפת תמונות לפי תיאור, סיווג ללא אימון מוקדם והזנה כבסיס למודלים מולטי-מודאליים כמו Llava. לפי הנתונים שפורסמו, השיטה הזו שיפרה ביצועים על משימות אחזור בטקסט קצר וארוך כאחד, והופכת מודלים שאומנו במקור רק על אנגלית לבעלי יכולת טובה יותר בריבוי שפות, בזכות הידע הלשוני של מודל השפה.

מתאים ל

  • חיפוש תמונות מבוסס טקסט

    מנועי חיפוש פנימיים שבהם המשתמשים מחפשים תמונות בעזרת משפטים שלמים ותיאורים מפורטים.

  • סיווג תמונות ללא דוגמאות

    זיהוי וחלוקה לקטגוריות על בסיס הנחיות טקסטואליות מורכבות ללא צורך באימון רשת נוספת.

  • בסיס למודל ראייה-שפה

    שימוש כמקודד תמונה ראשי עבור מודלים מולטי-מודאליים שדורשים הבנה חזותית מדויקת.

איפה זה נופל

יוצרי המודל מציינים במפורש שהתוצאות במאמר נבדקו על משקלי PyTorch מקוריים, ועשויים להיות הבדלי ביצועים בגרסה שמופצת דרך Hugging Face. בנוסף, הקוד דורש הרצת קוד מרוחק בהגדרות הטעינה, מה שעלול להוות מחסום אבטחה בארגונים מסוימים. אם תרצו להפיק אמבדינג של טקסט ולהשוות לתמונה, תצטרכו את מקודד הטקסט התואם של הפרויקט ולא את הטקסט-אינקודר הישן של CLIP, אחרת תאבדו את היתרון שלשמו המודל הזה נוצר.

שאלות
נפוצות

האם אפשר להשתמש במקודד הטקסט הרגיל של OpenAI עם המשקלים האלה?

עדיף שלא. כל הרעיון של LLM2CLIP הוא התאמה לייצוגים שהופקו ממודל שפה גדול, ולכן שימוש במקודד הטקסט הישן יפגע בדיוק השליפה ולא ינצל את היכולות של המודל.

האם צריך כרטיס מסך חזק במיוחד כדי להשתמש בו?

לא. מדובר בכ־579 מיליון פרמטרים ששוקלים קצת מעל שני גיגה בייט, כך שכל כרטיס פשוט עם כמה גיגות של זיכרון יריץ אותו בזמני תגובה טובים ב־float16.

איך מריצים

המשקל יושב על 2.2 גיגה בייט בלבד עם כ־579 מיליון פרמטרים, כך שאפשר להריץ אותו בקלות על כמעט כל כרטיס מסך מודרני, אפילו עם 6 עד 8 גיגה זיכרון וידאו אם טוענים אותו ב־float16. מריצים אותו ישירות מתוך ספריית transformers, אך חובה לסמן trust_remote_code כיוון שמדובר בארכיטקטורה מותאמת אישית של LLM2CLIP.

לקריאה מ־API של צד שלישי כמעט ואין הצדקה כאן, אלא אם כן אתם מחזיקים תשתית שלמה בשרת נטול מאיצים גרפיים ורוצים להימנע מניהול GPU. המודל קל מספיק לעיבוד מקומי מהיר וחסכוני.

pip install -U huggingface_hub
hf download microsoft/LLM2CLIP-Openai-L-14-336

הקבצים

8 קבצים במאגר, 2.2 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא Apache 2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו כחלק ממוצר סגור או פתוח. התנאי העיקרי הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗