GPT
V

vitmatte-small-composition-1k

קוד פתוח

hustvlapache-2.02023-09-10

  • transformers
  • pytorch
  • safetensors
  • vitmatte
  • vision

מודל קטן לגזירת עצמים מתמונות בדיוק גבוה. הוא שוקל פחות ממאתיים מגהבייט ומתאים למי שחייב לחלץ פרטים עדינים כמו שיער בלי לשלם על מודלי ענק.

  • 26Mפרמטרים
  • 197 MBמשקל הקבצים
  • 848,340הורדות בחודש
  • 56לייקים

מה זה

מדובר במודל שמיועד למשימת Image Matting, כלומר הערכה מדויקת של אלפא ושקיפות של אובייקט בקדמת התמונה. הוא מבוסס על שלד של Vision Transformer סטנדרטי שעליו הרכיבו ראש קל משקל, ואומן ספציפית על מאגר Composition-1k. עם כעשרים ושישה מיליון פרמטרים, הוא שייך לקטגוריית המשקל הנוצה בתחום הראייה הממוחשבת.

המטרה כאן אינה סתם חיתוך גס של גבולות כמו במודלי סגמנטציה רגילים, אלא מעבר רציף שמחלץ קצוות מטושטשים, פרווה וסיבי שיער. המשקל הכולל של הקבצים עומד על 197 מגהבייט בלבד, מה שהופך את השילוב שלו לפשוט מאוד בלי להעמיס על התשתיות או על הדיסק.

בגלל שהארכיטקטורה שלו נשענת על שנאי ראייה פשוט וראש ייעודי, הוא לא דורש רשתות כבדות ומסורבלות כדי להוציא חיתוך מדויק. הוא נותן פתרון ממוקד מאוד למשימה אחת מוגדרת מראש.

מתאים ל

  • חילוץ שיער וקצוות דקים

    מיועד להפרדת שקיפויות מורכבות של קווצות שיער, פרווה ורשתות שסגמנטציה רגילה הורסת.

  • החלפת רקע במוצרי מסחר

    הפרדה מדויקת של מוצרים מהרקע המקורי שלהם לצורך שתילה בקטלוג על רקע נקי.

  • עיבוד תמונה מקומי וזול

    שילוב גזירה איכותית בתוך שרת קיים בלי צורך בחומרה יקרה או בכרטיסי מסך כבדים.

איפה זה נופל

הכרטיס נכתב על ידי צוות האגינג פייס ולא על ידי החוקרים המקוריים, כך שאין בו שום פירוט רשמי לגבי הטיות, שגיאות נפוצות או מגבלות חומרה. המודל אומן על Composition-1k, מה שאומר שהוא מכיר סוג מסוים מאוד של קומפוזיציות ורקעים. בנוסף, מודלי מאטינג מהסוג הזה דורשים בדרך כלל קלט עזר כמו trimap כדי לדעת איפה להתמקד, ואם תזרקו עליו תמונה נקייה בלי הנחיה כזו תקבלו תוצאות עקומות לחלוטין.

שאלות
נפוצות

האם המודל הזה מחליף מודל סגמנטציה כמו SAM?

לא. מודל סגמנטציה מוצא את הגבול הגס של העצם, בעוד שמודל מאטינג מחשב שקיפות מדויקת בכל פיקסל. בדרך כלל משתמשים בסגמנטציה כדי לייצר מסכה ראשונית, ואז מעבירים אותה למודל הזה כדי לחלץ קצוות עדינים.

כמה זיכרון דרוש כדי להריץ אותו בפועל?

המודל שוקל 197 מגהבייט בדיוק מלא של 32 ביט. בזיכרון הראשי או בזיכרון של כרטיס המסך הוא יתפוס מאות בודדות של מגהבייט יחד עם התמונה, כך שגם מעבדים ישנים יריצו אותו בלי להיחנק.

איך מריצים

טוענים אותו ישירות דרך ספריית transformers הרגילה של פייתון באמצעות VitMatteForImageMatting. עם 26 מיליון פרמטרים בדיוק float32, אין שום צורך בכרטיס מסך מפלצתי. הוא ירוץ בקלות על כמעט כל מעבד גרפי בסיסי ואפילו על מעבד רגיל בצורה סבירה.

אם אתם צריכים עיבוד של כמה מאות תמונות בודדות פעם ב, שירות חיצוני מוכן אולי יחסוך תחזוקה. אבל ברגע שיש נפח תנועה אמיתי, הגודל המזערי של הקבצים הופך את ההרצה העצמית לפשוטה וזולה בהרבה משליחת נתונים החוצה.

from transformers import pipeline

pipe = pipeline("text-generation", model="hustvl/vitmatte-small-composition-1k")
print(pipe("שלום"))

הקבצים

6 קבצים במאגר, 197 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

רישיון apache-2.0 חופשי לגמרי. מותר לקחת את המודל, לשלב אותו במוצר מסחרי סגור, לשנות את הקוד ולהפיץ אותו ללקוחות. התנאים היחידים הם שמירה על הצהרת זכויות היוצרים המקורית והוספת עותק של הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗