GPT
D

dinov2-small

קוד פתוח

facebookapache-2.02023-07-31

  • transformers
  • pytorch
  • safetensors
  • dinov2
  • image-feature-extraction

מחלץ מאפיינים ויזואליים קל משקל שרץ על כל מעבד בלי מאמץ. פתרון נוח כשצריך וקטורים איכותיים מתמונות בלי להחזיק שרת יקר.

  • 22Mפרמטרים
  • 168 MBמשקל הקבצים
  • 4,319,462הורדות בחודש
  • 73לייקים

מה זה

מדובר בגרסה הקטנה של מודל הראייה מבית פייסבוק, שמבוססת על ארכיטקטורת Vision Transformer ומאומנת בשיטה ללא פיקוח. הוא לוקח תמונה, חותך אותה לחלקים קבועים, וממיר אותם למערך וקטורי שמייצג את המידע החזותי שבה, כולל טוקן ייעודי שמסכם את התמונה כולה.

בגודל של 22 מיליון פרמטרים ומשקל קבצים של 168 מגה בלבד, הוא נועד לעשות עבודה ממוקדת אחת: חילוץ מאפיינים. הוא לא מגיע עם ראש סיווג מוכן ולא יודע לתת תגיות מהקופסה, אלא משמש בסיס שממנו בונים פתרונות חיפוש תמונות, השוואת דמיון, או אימון מסווגים קלים על בסיס הייצוגים שלו.

מתאים ל

  • חיפוש תמונות לפי דמיון

    הפקת וקטורים מהירים להשוואת תמונות בקטלוגים על שרתים פשוטים.

  • סיווג תמונות מותאם אישית

    בסיס לאימון שכבה לינארית קלה על גבי נתונים מתויגים משלכם.

  • סינון כפילויות במאגרי מדיה

    זיהוי תמונות זהות או דומות מאוד בעזרת השוואת טוקן התמונה המרכזי.

איפה זה נופל

המודל הזה הוא מקודד בלבד. הוא לא מחזיר טקסט, לא עונה על שאלות ולא כולל ראש מסווג, כך שאם תרצו לקבל ממנו קטגוריה תצטרכו להוסיף שכבה לינארית ולאמן אותה בעצמכם על דאטה מתויג. בנוסף, מדובר בגרסת ה־small הבסיסית, ולכן ברמת הדיוק וההבחנה בפרטים דקים הוא מוגבל יותר מגרסאות גדולות יותר במשפחה הזו.

שאלות
נפוצות

האם המודל יודע להגיד לי מה יש בתמונה?

לא ישירות. הוא מחזיר ייצוג מספרי בלבד, ואתם צריכים להוסיף שכבת סיווג או להשוות את המספרים לתמונות קיימות כדי להבין את התוכן.

האם חובה להשתמש במעבד גרפי בשבילו?

ממש לא. הוא שוקל 168 מגה בלבד ומכיל 22 מיליון פרמטרים, כך שמעבד רגיל מריץ אותו בקלות לרוב השימושים השוטפים.

איך מריצים

טוענים אותו ישירות דרך ספריית transformers בפייתון עם AutoImageProcessor ו־AutoModel. בגלל הגודל המזערי שלו אין שום צורך בכרטיס מסך ייעודי כדי להתחיל לעבוד, ואפשר להריץ אותו ישירות על מעבד רגיל במחשב פיתוח או בשרת ענן בסיסי.

אם אתם צריכים לאנדקס מיליוני תמונות בזמן קצר, כרטיס מסך פשוט יקצר את הזמנים. בשביל נפחים קטנים או עיבוד שוטף של בקשות בודדות, אין שום סיבה לשלם על API חיצוני כשאפשר להחזיק את הקבצים אצלכם בחינם ובלי תלויות.

from transformers import pipeline

pipe = pipeline("image-feature-extraction", model="facebook/dinov2-small")
print(pipe("שלום"))

הקבצים

6 קבצים במאגר, 168 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא apache-2.0, שמאפשר שימוש מסחרי מלא, שינוי של הקוד והפצה חופשית בתוך המוצר שלכם. התנאי העיקרי הוא שמירת הקרדיט והודעת הרישיון המקורית, בלי דרישה לחשוף את הקוד שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗