GPT
S

sam-vit-huge

קוד פתוח

facebookapache-2.02023-04-10

  • transformers
  • pytorch
  • tf
  • safetensors
  • sam

הגרסה הכבדה ביותר של מודל החיתוך מבית פייסבוק, שמבודדת עצמים מתמונות לפי נקודה או תיחום. היא מיועדת למי שצריך דיוק מקסימלי בפיקסלים ולא מוכן להתפשר על איכות המסיכה.

  • 641Mפרמטרים
  • 7.2 GBמשקל הקבצים
  • 363,328הורדות בחודש
  • 198לייקים

מה זה

המודל חותך עצמים מתוך תמונות ומייצר מסיכות ברמת פיקסל, בלי שאימנו אותו מראש על האובייקט הספציפי שלכם. הוא עובד עם פרומפטים ויזואליים כמו נקודות בודדות או תיבות תוחמות שמסמנות איפה לחתוך, ומסוגל לייצר חלוקה מלאה של כל העצמים בתמונה על ידי פריסה של רשת נקודות אוטומטית.

הבסיס כאן הוא ארכיטקטורת ViT ענקית שכוללת מקודד תמונה כבד, מקודד הנחיות ומפענח מסיכות שמחבר ביניהם. הוא אומן על מאגר נתונים של 11 מיליון תמונות ומעל מיליארד מסיכות, מה שמקנה לו יכולת הכללה טובה מאוד על עצמים שלא ראה מעולם, אבל המחיר מגיע בזמני עיבוד ארוכים יותר בקידוד התמונה הראשוני.

מתאים ל

  • סימון אוטומטי של דאטה

    חיתוך אלפי אובייקטים מתמונות כדי לייצר מסכות אימון למודלים אחרים בלי עבודה ידנית.

  • בידוד עצמים לפי קליק

    כלי עריכה שמאפשר למשתמש ללחוץ על אזור בתמונה ולקבל מסיכה מיידית ומדויקת של האובייקט.

  • פירוק מלא של תמונה לחלקים

    חלוקת תמונה למקטעים על ידי רשת של אלף נקודות לטובת ניתוח סצנות מורכבות.

איפה זה נופל

הוא לא מקבל טקסט. אי אפשר לכתוב לו למצוא את הכלב, אלא חייבים לספק קואורדינטות, נקודות או תיבה. בנוסף, מדובר במשקל קבצים של מעל שבעה גיגה בייט בדיוק מלא, כך שקידוד התמונה איטי וכבד מדי לשימוש שדורש זמן אמת ללא כרטיס גרפי ייעודי.

שאלות
נפוצות

אפשר לתת למודל הזה הוראה טקסטואלית כמו למשל תחתוך את המכונית?

לא. המודל הספציפי הזה לא תומך בפרומפטים של טקסט לפי התיעוד והקוד שלו. אתם חייבים להעביר לו קואורדינטות של נקודה, תיחום גאומטרי או מסיכה קיימת כדי שהוא ידע מה לבודד.

כמה זיכרון כרטיס מסך המודל הזה דורש בפועל?

הקבצים שוקלים 7.2 גיגה בייט בדיוק של float32, כך שצריך לפחות 10 עד 12 גיגה בייט זיכרון וידאו פנוי כדי להעלות אותו ולעבד תמונות בלי קריסות של חוסר זיכרון, במיוחד בייצור מסיכות אוטומטי.

איך מריצים

מריצים אותו דרך ספריית transformers בפייתון בעזרת מעבד התמונה והמודל הייעודי. המשקל שלו דורש כרטיס מסך עם לפחות שמונה עד עשרה גיגה בייט זיכרון רק כדי לטעון אותו ל־CUDA, ואם תריצו חיתוך אוטומטי שמשתמש ברשת של 1024 נקודות, תצטרכו לחלק את העבודה למנות קטנות כדי לא לחנוק את החומרה.

אם אין לכם שרת עם מאיץ גרפי זמין, אל תנסו להריץ אותו מקומית על מעבד רגיל כי כל תמונה תיקח שניות ארוכות. במקרים של עומס נקודתי או שרתים קלים, עדיף להסתמך על תשתית ענן מנוהלת או לרדת לגרסאות קלות יותר של המודל.

from transformers import pipeline

pipe = pipeline("mask-generation", model="facebook/sam-vit-huge")
print(pipe("שלום"))

הקבצים

7 קבצים במאגר, 7.2 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא apache-2.0, מה שאומר שמותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו בתוך מוצר סגור או פתוח. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים וציון הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗