GPT
B

BiRefNet

קוד פתוח

ZhengPeng7mit2024-07-12

  • birefnet
  • safetensors
  • image-segmentation
  • background-removal
  • mask-generation

המודל מבודד אובייקטים ברזולוציה גבוהה ומיועד לחיתוך תמונות מדויק במיוחד. הוא תופס מעט מאוד מקום ומספק חלופה מקומית מצוינת להסרת רקע בלי לשלם על שירותי ענן חיצוניים.

  • 221Mפרמטרים
  • 424 MBמשקל הקבצים
  • 1,013,738הורדות בחודש
  • 635לייקים

מה זה

הארכיטקטורה כאן נבנתה במיוחד למשימות סגמנטציה דיכוטומית, כלומר הפרדה חדה ומוחלטת בין האובייקט המרכזי לרקע. עם 221 מיליון פרמטרים בלבד, הוא ממוקד במטרה אחת: לחלץ עצמים עם קצוות מורכבים כמו שיער, שרשראות דקות או מבנים עדינים, תחומים שבהם מודלי זיהוי כלליים בדרך כלל מייצרים שוליים מטושטשים ומרוחים.

לפי המפתחים, המודל הגיע לביצועים המובילים בשלוש משימות שונות: סגמנטציה ברזולוציה גבוהה, זיהוי אובייקטים בולטים, וזיהוי אובייקטים מוסווים. המשמעות המעשית היא שהוא לא מסתמך רק על ניגודיות פשוטה של צבעים כדי לחתוך את התמונה, אלא מסוגל לזהות את הגבול האמיתי של העצם גם כשהוא נטמע עמוק בתוך רקע עמוס ומורכב.

מתאים ל

  • הסרת רקע לתמונות מוצר

    מבודד מוצרים לקטלוגים ומסחר אלקטרוני בדיוק גבוה, כולל קצוות חדים ודקים.

  • עיבוד תמונות סטודיו ודיוקנאות

    מתמודד היטב עם שיער ופרווה שלא נחתכים טוב במודלים רגילים.

  • חילוץ אובייקטים מוסווים

    מפריד עצמים שנטמעים ברקע וקשים לזיהוי בעזרת ניגודיות פשוטה.

איפה זה נופל

האימון נעשה על סט נתונים ייעודי להפרדה דיכוטומית בשם DIS-TR. הוא מניח מראש שיש אובייקט ברור שצריך לחלץ, ולא יתאים למי שמחפש סגמנטציה פנאופטית או סיווג של כל פיקסל לעשרות קטגוריות שונות בתמונה. אם הסצנה מכילה עשרות פריטים שווים בחשיבותם ללא מוקד עניין מוגדר, הוא עלול להיכשל בבחירת הנושא הנכון.

שאלות
נפוצות

האם אני חייב כרטיס מסך חזק כדי להריץ אותו?

לא. המודל שוקל 424 מגה בייט וכולל 221 מיליון פרמטרים בלבד. כרטיס מסך בסיסי לחלוטין מספיק להסרת רקע מהירה, ואפשר אפילו להריץ אותו על המעבד אם מדובר בתמונות בודדות ולא בפס ייצור רציף.

למה נדרש הדגל trust_remote_code בזמן הטעינה?

הארכיטקטורה של המודל אינה חלק מובנה מליבת ספריית transformers הרשמית. הדגל מאפשר להוריד ולהריץ את קובצי המימוש שהמחברים כתבו ישירות מהעמוד שלו ב־Hugging Face.

האם הוא יודע לזהות מה סוג האובייקט שנחתך?

לא, הוא רק מפריד בין העצם המרכזי לרקע ומחזיר מסיכת חיתוך. הוא לא מחזיר תגיות סיווג כמו אדם, מכונית או כלב.

איך מריצים

טעינת המודל מתבצעת ישירות דרך ספריית transformers באמצעות הקריאה ל־AutoModelForImageSegmentation, אך היא דורשת הפעלה של trust_remote_code כיוון שהקוד המקורי רץ ישירות מהמאגר. המשקל הכולל של הקבצים עומד על 424 מגה בייט בלבד, כך שלא צריך שרתי ענק כדי להריץ אותו.

כרטיס מסך ביתי מודרני עם זיכרון צנוע יספיק כאן להרצה מקומית מהירה, ואין שום הצדקה לשלם לספקי API חיצוניים אם כבר יש לכם מכונה פנויה. אם מריצים אצווה גדולה מאוד של תמונות ברזולוציית מקור גבוהה במיוחד, כדאי לשים לב לצריכת הזיכרון הגרפי בזמן עיבוד הפיקסלים בפועל.

pip install -U huggingface_hub
hf download ZhengPeng7/BiRefNet

הקבצים

9 קבצים במאגר, 424 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל משוחרר תחת רישיון MIT. מותר להשתמש בו לצרכים מסחריים ופרטיים, לשנות את הקוד ולהפיץ אותו בתוך מוצר סגור, בתנאי ששומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗