GPT
D

DAM-3B

קוד פתוח

nvidiaother2025-04-21

  • describe-anything
  • safetensors
  • llava_llama
  • image-text-to-text
  • en

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

מודל ראייה ושפה קטן שמתמקד בתיאור אזורים ספציפיים בתוך תמונה לפי מסכה, נקודה או תיחום. פתרון ממוקד כשצריך פירוט על אובייקט בודד בלי לאבד את ההקשר הכללי של התמונה.

  • 6.6 GBמשקל הקבצים
  • 15,692הורדות בחודש
  • 130לייקים

מה זה

המודל פותח על ידי אנבידיה בשיתוף ברקלי ויוסיאסאף, והוא מבוסס על VILA-1.5 וארכיטקטורת LlavaLlama המשלבת ViT ו־Llama. בניגוד למודלי ראייה שמספקים תיאור כללי לכל התמונה, כאן מזינים תמונת RGB יחד עם מסכה בינארית, נקודות, שרבוט או תיבות תוחמות שמסמנים אזור מסוים. הוא משתמש במנגנון gated cross-attention כדי לשלב בין התמונה המלאה לפרטים הקטנים של החלק שבחרתם.

המשקל שלו עומד על שלושה מיליארד פרמטרים, והוא אומן על מאגר נתונים ייעודי שנקרא Describe Anything Training Datasets ונבדק על DLC-Bench. השילוב הזה נותן כיתוב מפורט ברמת האזור הספציפי, מה ששימושי במיוחד כשרוצים לנתח רכיב ספציפי בלי לקבל תיאור כללי וסתמי של כל הפריים מסביב.

מתאים ל

  • חיתוך ותיאור אובייקטים

    קבלת תיאור טקסטואלי עשיר ומדויק עבור פריט בודד שסומן בתוך תמונה שלמה.

  • תיוג נתונים לאימון

    יצירת כיתובים מפורטים לחלקי תמונות עבור אימון של מודלי סגמנטציה אחרים במחקר.

  • ניתוח מונחה משתמש

    מתן אפשרות למשתמש לסמן נקודה או שרבוט על המסך ולקבל פירוט מיידי על האלמנט.

איפה זה נופל

הרזולוציה הנמוכה של 384 על 384 פיקסלים היא המגבלה הבולטת ביותר. אם האובייקט שסימנתם קטן מאוד בתמונה המקורית, הדחיסה לגודל הזה עלולה למחוק פרטים חיוניים עוד לפני שהמודל התחיל לנתח אותם. בנוסף, המודל תומך ומייצר טקסט באנגלית בלבד, כך שאי אפשר לצפות לקבל ממנו פלט ישיר בעברית בלי תרגום נוסף בשרשרת.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה במוצר מסחרי?

לא. המודל מופץ תחת רישיון לא מסחרי של אנבידיה ומוגדר לצורכי מחקר ופיתוח בלבד. אם המטרה היא להריץ שירות שגובה כסף או כחלק ממוצר פעיל בחברה, הרישיון הנוכחי לא מאפשר זאת.

האם המודל מבין ומפיק טקסט בעברית?

הכרטיס מפרט תמיכה בשפה האנגלית בלבד. אם תשלחו לו הנחיות בעברית או תצפו לתיאורים בעברית, הביצועים לא יהיו צפויים, ומוטב לתרגם את הקלט והפלט בשכבה נפרדת.

איך מריצים

המשקלים שוקלים כ־6.6 ג'יגה בייט ורצים דרך PyTorch בספריית describe-anything על לינוקס. כדי להריץ אותו כמו שצריך נדרש כרטיס מסך של אנבידיה מארכיטקטורות Ampere, Lovelace או Hopper, כאשר כרטיס עם 8 עד 12 ג'יגה זיכרון וידאו יספיק לעבודה שוטפת.

רזולוציית הקלט מוגבלת ל־384 על 384 פיקסלים, כך שאם יש לכם תמונות ענקיות תצטרכו להקטין אותן מראש. אם אין לכם חומרה של אנבידיה בשרת, תצטרכו לחפש חלופות מבוססות ענן כי תמיכה בחומרה אחרת לא מצוינת כאן.

pip install -U huggingface_hub
hf download nvidia/DAM-3B

הרישיון

הרישיון הוא רישיון לא מסחרי של אנבידיה שמיועד למחקר ופיתוח בלבד. אי אפשר להטמיע את המודל במוצר חי שמניב הכנסות או משווק ללקוחות מסחריים בלי להסתכן בהפרת תנאי הרישיון.

הרישיון המלא בעמוד המודל ↗