GPT
C

clipseg-rd64-refined

קוד פתוח

CIDASapache-2.02022-11-01

  • transformers
  • pytorch
  • safetensors
  • clipseg
  • vision

מודל סגמנטציה שמבודד אובייקטים בתמונה לפי טקסט חופשי או תמונת דוגמה. הוא שוקל מעט מאוד ומתאים למי שצריך חיתוך מהיר בלי לאמן רשת ייעודית.

  • 151Mפרמטרים
  • 77טוקנים בהקשר
  • 1.1 GBמשקל הקבצים
  • 1,219,663הורדות בחודש

מה זה

מדובר במודל שמתבסס על ארכיטקטורת CLIPSeg ומיועד לסגמנטציה של תמונות בשיטת zero-shot ו־one-shot. במקום לאמן מודל כבד על קטגוריות קבועות מראש, נותנים לו תמונה והנחיה מילולית קצרה או תמונת רפרנס, והוא מייצר מסיכה שמבודדת את האזור המבוקש. הגרסה הזו משתמשת בהפחתת ממדים ל־64 וכוללת שכבת קונבולוציה מורכבת יותר לעידון התוצאה.

עם 151 מיליון פרמטרים, הוא קטן בהרבה ממודלי ראייה מודרניים אחרים. זה אומר שהוא לא ייתן לכם חיתוכים ברמת פיקסל מושלמת לקצוות של שערות, אבל הוא נותן מענה מהיר כשצריך להבין איפה נמצא עצם מסוים בתמונה בלי להחזיק תשתית מחשוב יקרה.

מתאים ל

  • בידוד אובייקטים לפי טקסט

    חיתוך פריטים מתמונות על בסיס הנחיה מילולית פשוטה בלי להגדיר מראש קטגוריות.

  • סגמנטציה עם תמונת דוגמה

    איתור עצמים דומים בתמונה חדשה בהתבסס על תמונת מקור אחת בשיטת one-shot.

  • יצירת מסיכות לעריכה

    סימון אזורים בתמונה לצורך מחיקה או החלפה בצורה אוטומטית וקלת משקל.

איפה זה נופל

חלון ההקשר מוגבל ל־77 טוקנים בלבד, בדיוק כמו המגבלה המקורית של CLIP. אי אפשר להעביר לו תיאורים ארוכים ומורכבים של סצנות, אלא פקודות ממוקדות וקצרות מאוד. הוא פורסם בסוף 2022, כך שהוא לא מכיר ארכיטקטורות סגמנטציה חדשות יותר. המפרט בדף המודל דל מאוד ולא מציג תוצאות מבחנים רשמיות, ולכן חובה לבדוק אותו עצמאית על התמונות שלכם לפני שסומכים על דיוק המסיכות.

שאלות
נפוצות

האם המודל תומך בהנחיות בעברית?

המודל נשען על טוקנייזר ואימון שמבוססים על אנגלית, עם מגבלה של 77 טוקנים. פקודות בעברית כנראה לא יניבו תוצאות טובות, ולכן עדיף לתרגם את הטקסט לאנגלית לפני ששולחים אותו למודל.

איך הגרסה הזו שונה מגרסאות אחרות של CLIPSeg?

השם מציין שימוש ב־reduce dimension 64 יחד עם תהליך עידון, refined, שמתבסס על שכבת קונבולוציה מורכבת יותר. התוספת הזו נועדה לשפר את החדות ואיכות המסיכה ביחס לגרסאות הבסיסיות של אותו מחקר.

איך מריצים

טוענים אותו ישירות דרך ספריית transformers עם המחלקה CLIPSegForImageSegmentation. קבצי המשקלים תופסים כ־1.1 ג'יגה בייט בפורמט float32, כך שלא צריך שרת מפלצתי בשבילו. כל כרטיס מסך בסיסי עם 4 עד 6 ג'יגה זיכרון יריץ אותו בלי בעיה, ואפשר אפילו לדחוף אותו למעבד רגיל אם זמן התגובה פחות קריטי לכם.

הוא מיועד להרצה עצמית מלאה אצלכם. אין סיבה אמיתית לשלם לספק ענן על קריאות API חיצוניות עבור מודל כל כך קל, אלא אם התשתית שלכם כבר בנויה לגמרי סביב שירותים מנוהלים ואין לכם רצון לתחזק שרת פנימי.

from transformers import pipeline

pipe = pipeline("image-segmentation", model="CIDAS/clipseg-rd64-refined")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache 2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו כחלק ממוצר שלכם. התנאים דורשים בעיקר לשמור על הודעת זכויות היוצרים המקורית ולציין אם ביצעתם שינויים בקוד.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗