GPT
F

finegrain-box-segmenter

קוד פתוח

finegrainmit2024-08-29

  • refiners
  • safetensors
  • vision
  • image-segmentation
  • matting

המודל מייצר מסכות חיתוך ברזולוציית 1024 על 1024 לפי תיחום מלבני. הוא מיועד למי שצריך דיוק גבוה סביב מוצרים בלי מריחות בשוליים.

  • 95Mפרמטרים
  • 181 MBמשקל הקבצים
  • 12,487הורדות בחודש
  • 127לייקים

מה זה

הארכיטקטורה מבוססת על MVANet ואומנה על כעשרת אלפים תמונות, בעיקר פריטי עיצוב פנים ומוצרים מסחריים. הרעיון כאן הוא לקבל תמונה יחד עם קואורדינטות של תיבה תוחמת, ולהחזיר מסיכת אלפא נקייה סביב העצם שבחרתם, במקום לנחש לבד מה נחשב לאובייקט ראשי.

בבדיקה שהיוצרים ערכו על 120 תמונות מוצר מול RMBG ו־BiRefNet, הוא הגיע לציון Dice של 96.7 אחוז ו־MAE של 0.0078. המשמעות בפועל היא פחות שגיאות הצמדה בפיקסלים בודדים ומעקב הדוק יותר אחרי מתאר מורכב, בלי שצריך להעביר את התוצאה עיבוד נוסף של טרימאפ.

מתאים ל

  • בידוד פריטים בקטלוג

    הוא חותך מוצרים ישירות מתוך צילומי סטודיו ברזולוציה גבוהה ומספק ערוץ אלפא מוכן להחלפת רקעים.

  • עריכת תמונות מונחית משתמש

    מאפשר לסמן שטח מלבני סביב חפץ בתמונה כדי למחוק אותו, לצבוע אותו מחדש או להחליף אותו.

  • חיתוך לפי טקסט בצנרת קיימת

    מתחבר בקלות למודל שמאתר קואורדינטות של עצמים לפי שם, ומשלים את הפקת המסכה החדה.

איפה זה נופל

הוא מוגדר כגרסה ראשונית ויש לו נקודות תורפה ברורות. הוא מתקשה כשהחפץ נוגע ישירות בקצה הפריים, מתבלבל סביב השתקפויות חזקות, צללים כבדים, או כשיד מחזיקה את הפריט. בנוסף, הוא לא יודע להתמודד עם עצמים שקופים או דקיקים במיוחד, ואי אפשר לשלוח אליו טקסט ישירות בלי רכיב חיצוני שיתרגם את המילה לתיחום.

שאלות
נפוצות

האם אפשר פשוט לכתוב לו מה לחתוך כמו במודלים של טקסט?

לא, המודל הזה מקבל אך ורק תמונה ותיבת גבולות מספרית. כדי לחתוך לפי שם של פריט תצטרכו להריץ לפניו מודל שמזהה את האובייקט ומחזיר את הקואורדינטות שלו, כפי שהמפתחים עשו בהדגמה שלהם.

איך הוא בהשוואה למודלים מוכרים כמו SAM?

SAM ודומיו מייצרים מסכה פנימית ברזולוציה של 256 על 256 ומגדילים אותה, מה שיוצר עיוותים באובייקטים מורכבים. כאן העיבוד נעשה ישירות ברזולוציית 1024 על 1024, מה שנותן שוליים חדים בהרבה על מוצרים.

האם אפשר להשתמש בו ישירות להסרת רקע כללית בלי לסמן תיבה?

כן, אפשר להעביר את התמונה כולה בלי לתת תיחום מוגדר, והוא יתפקד כמסיר רקע רגיל. עם זאת, הוא נבנה ואומן במיוחד לעבודה עם תיחום, כך ששם תקבלו את התוצאות הטובות ביותר.

איך מריצים

המודל שוקל 181 מגה בייט וכולל פחות ממאה מיליון פרמטרים, כך שאפשר להריץ אותו מקומית על כמעט כל מעבד גרפי סטנדרטי בלי לשבור את הראש על זיכרון. ההרצה בקוד נעשית דרך ספריית refiners בפייתון בכמה שורות בודדות, או כתוסף ב־ComfyUI.

גרסת הקוד הפתוח מחייבת אתכם לספק את התיבה בעצמכם. היוצרים מציעים גם גישה ל־API מסחרי שמבטיח מהירות ודיוק משופרים, כך שאם אתם לא רוצים להחזיק שרת או לפתח לבד את שלב זיהוי התיבה בתמונה, פנייה ישירה אליהם עשויה לחסוך עבודה.

pip install -U huggingface_hub
hf download finegrain/finegrain-box-segmenter

הקבצים

4 קבצים במאגר, 181 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

רישיון MIT מלא. אתם יכולים לשלב אותו במוצר מסחרי, לשנות את הקוד ולהריץ אותו איפה שרוצים, בלי תמלוגים. התנאי היחיד הוא שמירה על הצהרת זכויות היוצרים של המפתחים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗