GPT
D

dinov2-giant

קוד פתוח

facebookapache-2.02023-07-17

  • transformers
  • pytorch
  • safetensors
  • dinov2
  • image-feature-extraction

חילוץ וקטורים מתמונות ברמה גבוהה מאוד בלי צורך באימון מונחה מראש. הוא מיועד למי שחייב ייצוג ויזואלי עמוק ומדויק במיוחד, ומוכן לשלם על זה במשאבי חישוב כבדים.

  • 1.1Bפרמטרים
  • 8.5 GBמשקל הקבצים
  • 281,571הורדות בחודש
  • 64לייקים

מה זה

מדובר במודל ראייה ממוחשבת שמבוסס על ארכיטקטורת שנאי, שאומן בשיטה של למידה עצמית על מאגר תמונות גדול. התמונות מחולקות לטלאים קבועים והופכות לרצף של היטלים לינאריים, בדומה לאופן שבו מודלים טקסטואליים מעבדים מילים. המודל כולל טוקן סיווג ייעודי שמרכז את המידע על התמונה כולה, לצד הטמעות מיקום מוחלטות על פני ארבעים שכבות.

המטרה העיקרית שלו היא להפיק ייצוג פנימי עשיר של תמונות שמשמש כבסיס למשימות המשך. אין כאן מנגנון מוכן לסיווג או זיהוי ספציפי, אלא חולץ מאפיינים טהור. היתרון בגרסת הענק הזו הוא העומק של הייצוגים הוויזואליים שהיא מייצרת, שמאפשרים לחבר מעליה שכבה לינארית פשוטה ולקבל תוצאות חזקות על דאטה מתויג בלי לאמן את כל הרשת מחדש.

מתאים ל

  • חילוץ מאפיינים לסיווג

    הפקת וקטור כולל מתמונה דרך טוקן הסיווג כדי לאמן מעליו מסווג לינארי קל על דאטה משלכם.

  • חיפוש דמיון ויזואלי

    יצירת אינדקס של וקטורים ממאגר תמונות גדול כדי למצוא תמונות דומות מבחינה ויזואלית ברמת דיוק גבוהה.

  • בסיס למשימות ראייה

    שימוש במשקלים המאומנים כנקודת מוצא חזקה למודלים מורכבים יותר שדורשים הבנה מרחבית של חלקי התמונה.

איפה זה נופל

המודל מגיע גולמי לחלוטין וללא ראש סיווג מאומן. הוא לא יודע להגיד לכם מה מופיע בתמונה, לסמן אובייקטים או לענות על שאלות, אלא רק להחזיר וקטורים מספריים. המשמעות היא שאי אפשר להשתמש בו ישירות במוצר קצה בלי לבנות ולאמן שכבה נוספת מעליו, או לשלב אותו במערכת חיפוש וקטורי. בנוסף, הצוות המקורי שפיתח אותו בפייסבוק כלל לא כתב עבורו כרטיס מודל, ולכן אין שום מידע רשמי על הטיות ויזואליות, ביצועים על סוגי דאטה שונים, או מגבלות ספציפיות שנבדקו באופן שיטתי.

שאלות
נפוצות

האם המודל יודע לתת לי תגיות או שמות של עצמים בתמונה?

לא. המודל מחזיר רק וקטורים של מצבים נסתרים מתוך ארבעים השכבות שלו, ולא טקסט או תוויות. כדי לקבל שמות של עצמים תצטרכו לאמן ראש סיווג מעליו או לחפש גרסה שעברה כוונון עדין למשימה הזו.

האם חייבים כרטיס מסך כדי להשתמש בו?

טכנית אפשר לטעון אותו על מעבד מרכזי רגיל, אבל בגלל המשקל של שמונה וחצי גיגה בייט ויותר ממיליארד פרמטרים, כל תמונה תיקח שניות ארוכות. לעבודה מעשית או לעיבוד כמויות של תמונות נדרש מאיץ גרפי ייעודי עם מספיק זיכרון.

איך מריצים

טעינת המודל מתבצעת ישירות דרך ספריית transformers בפייתון עם שימוש במעבד התמונה התואם. קבצי המודל שוקלים שמונה וחצי גיגה בייט בפורמט של נקודה צפה מלאה, כך שעל הנייר נדרש כרטיס מסך מודרני עם מספיק זיכרון וידאו פנוי רק כדי לטעון אותו, ועוד תוספת בשביל להריץ אצוות של תמונות בפועל.

אם אתם צריכים לחלץ וקטורים בזמן אמת מול משתמשים או להריץ את זה בסביבה דלת משאבים, הגודל הזה יהווה צוואר בקבוק רציני. במקרים כאלה עדיף לבדוק את הגרסאות הקטנות יותר של אותה משפחה, או לחלופין לטעון אותו על שרת ייעודי חזק ולפנות אליו כשירות פנימי נפרד.

from transformers import pipeline

pipe = pipeline("image-feature-extraction", model="facebook/dinov2-giant")
print(pipe("שלום"))

הקבצים

6 קבצים במאגר, 8.5 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא אפאצ'י שתיים אפס, שמאפשר שימוש מסחרי, שינוי של הקוד והפצה חופשית ללא תמלוגים. אתם יכולים לשלב אותו במוצר מסחרי ולשלוח אותו ללקוחות, כל עוד אתם שומרים על הודעות זכויות היוצרים והרישיון המקוריות ומציינים שינויים שבוצעו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗