GPT
D

dinov2-large

קוד פתוח

facebookapache-2.02023-07-17

  • transformers
  • pytorch
  • safetensors
  • dinov2
  • image-feature-extraction

מודל ויז'ן שמפיק ייצוגים וקטוריים חזקים מתמונות בלי שאימנו אותו על תוויות. הוא מתאים למי שבונה חיפוש תמונות, קלאסיפיקציה מותאמת אישית או חילוץ מאפיינים ברמה גבוהה.

  • 304Mפרמטרים
  • 2.3 GBמשקל הקבצים
  • 710,384הורדות בחודש
  • 119לייקים

מה זה

מדובר במקודד מבוסס ארכיטקטורת Vision Transformer עם 24 שכבות וקצת מעל 304 מיליון פרמטרים, שאומן בשיטת למידה עצמית על מאגר תמונות ענק. הרעיון פה הוא לקחת תמונה, לפרק אותה לטלאים בגודל קבוע, ולהוציא וקטור שמייצג את התוכן החזותי שלה בדיוק גבוה.

הוא לא מגיע עם ראש סיווג מוכן ולא יגיד לכם אם יש בתמונה חתול או כלב. במקום זה, מקבלים שכבה חבויה אחרונה וטוקן ייעודי שמסכמים את כל המידע הוויזואלי, כדי שתוכלו להלביש עליהם שכבה לינארית פשוטה משלכם או להשתמש בווקטורים להשוואת דמיון.

מתאים ל

  • חילוץ וקטורים לתמונות

    מייצר ייצוג מספרי מפורט של תמונה לצורך חיפוש דמיון ויזואלי במאגרים גדולים.

  • אימון מסווגים מהיר

    מלבישים שכבה לינארית בודדת על גבי טוקן הסיווג ומאמנים קלאסיפייר על מעט דאטה.

  • בסיס למשימות ראייה

    משמש עמוד שדרה ויזואלי למערכות שצריכות להבין את תוכן התמונה לפני עיבוד נוסף.

איפה זה נופל

המודל הזה גולמי לחלוטין. הוא לא יודע לסווג, לא מזהה תיבות גבול של אובייקטים ולא מייצר טקסט, כך שאם אתם מצפים לקבל תשובה מוכנה מהקופסה תצטרכו לאמן ראש סיווג בעצמכם על נתונים מתויגים. בנוסף, הצוות שאימן אותו בפייסבוק אפילו לא טרח לכתוב עבורו כרטיס מודל רשמי עם מדדי ביצועים, כך שאין שום תיעוד על הטיות פנימיות או מגבלות ספציפיות בסוגי תמונות מסוימים.

שאלות
נפוצות

האם המודל יודע להגיד לי מה מופיע בתמונה?

לא ישירות. המודל מוציא רק וקטורים מספריים של מאפיינים, ולא שמות של עצמים. תצטרכו להוסיף מעליו שכבת סיווג ולאמן אותה על המידע שלכם.

האם אפשר להריץ אותו על מעבד רגיל בלי כרטיס מסך?

כן. עם 304 מיליון פרמטרים הוא יחסית קל משקל, ומעבד מודרני יכול להריץ אינפרנס בסיסי של תמונה בודדת בלי בעיה מיוחדת.

איך מריצים

המשקלים שוקלים בערך 2.3 גיגה בייט בדיוק מלא, כך שכרטיס מסך מודרני פשוט עם שמונה גיגה זיכרון מריץ אותו בלי להזיע בכלל, ואפילו מעבד סביר יסחוב את זה. טוענים אותו ישירות דרך ספריית transformers בפייתון עם AutoImageProcessor ו־AutoModel.

בגלל המשקל הקומפקטי שלו, אין שום סיבה אמיתית לשלם לספק ענן על שירות מנוהל כדי להוציא וקטורים מתמונות. מריצים מקומית או בתוך קונטיינר עצמאי וסוגרים עניין.

from transformers import pipeline

pipe = pipeline("image-feature-extraction", model="facebook/dinov2-large")
print(pipe("שלום"))

הקבצים

6 קבצים במאגר, 2.3 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא apache-2.0, שזה מעולה. מותר להשתמש בו במוצרים מסחריים, לשנות את הקוד ולהפיץ אותו חופשי, כל עוד שומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗