GPT
D

dinov2-base

קוד פתוח

facebookapache-2.02023-07-17

  • transformers
  • pytorch
  • safetensors
  • dinov2
  • image-feature-extraction

חילוץ וקטורים חזקים מתמונות בלי שאימנו אותו מראש לתיוג ספציפי. הבחירה בו מתאימה למי שרוצה בסיס ראייה ממוחשבת מוכן לחיבור מעליו.

  • 87Mפרמטרים
  • 661 MBמשקל הקבצים
  • 3,081,152הורדות בחודש
  • 196לייקים

מה זה

מדובר בארכיטקטורת Vision Transformer עם 12 שכבות וכמעט 87 מיליון פרמטרים, שאומנה באימון עצמי ללא תיוג ישיר על אוסף עצום של תמונות. הוא מפרק כל תמונה לרצף של פיסות קבועות, מקודד אותן ומעביר אותן דרך שכבות הטרנספורמר כדי לייצר ייצוג מספרי פנימי של התמונה כולה.

המודל מפיק את המידע דרך טוקן ה־CLS בסוף הרשת, מה שנותן וקטור שמכיל את המשמעות הוויזואלית של התמונה. הוא מיועד לשמש בסיס שממנו מושכים מאפיינים, ולא כולל ראש סיווג מוכן משלו, כך שהתוצר שלו הוא וקטורים ולא תוויות מוכנות מראש.

מתאים ל

  • חילוץ וקטורים מתמונות

    מייצר ייצוג מספרי קומפקטי לכל תמונה לצורך שמירה במסד נתונים וקטורי.

  • בסיס למסווג תמונות

    הוספת שכבה לינארית מעל טוקן ה־CLS ואימון מהיר על דאטה מתויג שלכם.

  • חיפוש דמיון ויזואלי

    השוואת וקטורים בין תמונות שונות כדי למצוא פריטים דומים בלי תגיות.

איפה זה נופל

המודל מגיע גולמי לגמרי וללא ראש מאומן למשימה ספציפית, כך שהוא לא מסוגל לסווג תמונות ישר מהקופסה. כדי להשתמש בו למיון או לזיהוי, חייבים להוסיף שכבה לינארית מעל טוקן ה־CLS ולאמן אותה על נתונים מתויגים שלכם. כרטיס המודל לא נכתב על ידי הצוות שאימן אותו אלא על ידי צוות Hugging Face, ואין בו שום תוצאות מדידה מספריות, ציוני דיוק או בדיקות של הטיות.

שאלות
נפוצות

האם המודל יכול להחזיר לי שם של אובייקט בתמונה?

לא. המודל הגולמי לא כולל ראש סיווג ולא מחזיר טקסט או תוויות, אלא וקטור תכונות מתמטי בלבד. כדי לקבל שמות של עצמים תצטרכו לאמן מעליו שכבה מסווגת או לחפש גרסה שעברה fine-tuning למשימה הזו.

כמה זיכרון דרוש כדי להריץ אותו אצלי?

המודל שוקל 661 מגה בייט בדיוק float32, כך שהוא דורש פחות מגיגה בייט של זיכרון RAM או VRAM כדי לטעון אותו ולבצע היקש. כל מחשב פיתוח מודרני מריץ אותו בלי בעיה גם על גבי המעבד המרכזי.

איך מריצים

המשקל הכולל של הקבצים עומד על 661 מגה בייט בפורמט float32, מה שאומר שאפשר להריץ אותו בקלות על כל מעבד סביר או כרטיס מסך בסיסי בלי לתפוס כמעט זיכרון. טוענים אותו ישירות דרך ספריית transformers עם AutoImageProcessor ו־AutoModel ומעבירים אליו תמונה דרך פייתון.

בגודל כזה של 87 מיליון פרמטרים אין שום הצדקה לשלם לספק ענן חיצוני על API לחילוץ תכונות. המודל קל מספיק לתחזוקה עצמית מקומית גם בשרתים צנועים בלי להסתבך עם עלויות קריאה פר תמונה.

from transformers import pipeline

pipe = pipeline("image-feature-extraction", model="facebook/dinov2-base")
print(pipe("שלום"))

הקבצים

6 קבצים במאגר, 661 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הוא מופץ תחת רישיון apache-2.0, שמתיר שימוש מסחרי מלא, שינוי של הקוד והפצה פנימית או חיצונית כחלק ממוצר. התנאי העיקרי הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי, בלי דרישה לפתוח את הקוד של המוצר שבו תשלבו אותו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗