GPT
L

LocateAnything-3B

קוד פתוח

nvidiaother2026-03-02

  • transformers
  • safetensors
  • locateanything
  • feature-extraction
  • nvidia

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

מודל ראייה ושפה קומפקטי שמאתר אובייקטים ומחזיר קואורדינטות מדויקות ישירות מטקסט חופשי. הוא פותר את צוואר הבקבוק האיטי של יצירת קופסאות תוחמות באמצעות פענוח מקבילי מהיר פי 2.5 מגישות קודמות.

  • 3.8Bפרמטרים
  • 32,768טוקנים בהקשר
  • 7.3 GBמשקל הקבצים
  • 105,173הורדות בחודש

מה זה

במקום לחכות שהמודל ייצר קואורדינטה אחרי קואורדינטה בצורה סדרתית מעייפת, הפיתוח כאן פולט קופסאות תוחמות ונקודות שלמות במקביל בבלוקים של שישה טוקנים. מתחת למכסה המנוע יושבים המודל הלשוני Qwen2.5 בגרסת 3B ומקודד התמונה MoonViT, שילוב שמאפשר לזהות אלמנטים לפי תיאור מילולי מורכב, לאתר כפתורים בממשקי משתמש, לפענח מסמכים ולסמן טקסט בתמונה.

האימון נעשה על 12 מיליון תמונות ומעל 138 מיליון שאילתות, מה שנותן לו יכולת התמודדות טובה בסצנות עמוסות בפרטים. המודל מציע שלושה מצבי עבודה, כאשר ברירת המחדל היא מצב היברידי שמנסה לייצר קואורדינטות במקביל ונופל לפענוח סדרתי רגיל רק כשיש עמימות גיאומטרית.

מתאים ל

  • איתור אלמנטים לסוכני מחשב

    זיהוי כפתורים ושדות קלט במסכים ברזולוציה גבוהה לצורך לחיצה אוטומטית לפי פקודה מילולית.

  • תיוג אוטומטי של תמונות

    סימון מהיר של קופסאות תוחמות וחלקי אובייקטים בכמויות גדולות לצורך בניית מאגרי מידע.

  • חילוץ מידע ממסמכים

    איתור מיקומים מדויקים של פסקאות, תוויות וקטעי טקסט בסריקות מורכבות.

איפה זה נופל

הנתונים והאימון מתמקדים בשפה האנגלית בלבד, כך ששאילתות בעברית לא יעבדו בצורה אמינה. למרות היכולת לקבל תמונות עד רזולוציית 2.5K, סביבת ההרצה עדיין תלויה בספריית transformers ללא אופטימיזציות מנוע מתקדמות, ודרישות הזיכרון עלולות לזנק מעל 35 ג'יגה בייט אם לא מקנפגים ידנית את מנגנון הקשב הייעודי.

שאלות
נפוצות

האם המודל מבין הוראות ותוויות בעברית?

האימון נעשה על טקסטים באנגלית בלבד. אם תזינו שאילתות בעברית הוא כנראה ייכשל באיתור האובייקטים, ולכן יש לתרגם את הטקסט לאנגלית לפני הפנייה למודל.

איזה כרטיס מסך מינימלי צריך כדי להריץ אותו בפועל?

בשימוש במנגנון הקשב היעיל של המודל אפשר להסתפק בכרטיס עם 16 עד 24 ג'יגה בייט של זיכרון גרפי כמו RTX 4090. אם תריצו אותו עם המימוש הבסיסי ללא אופטימיזציה, הוא יצרוך מעל 35 ג'יגה בייט וידרוש כרטיס שרת כמו A100.

איך מריצים

המודל שוקל 7.3 ג'יגה בייט בפורמט bfloat16 ורץ דרך ספריית transformers הרגילה בסביבת לינוקס. במבחן ביצועים על תמונת 4K עם מנות של ארבע תמונות, שימוש במימוש הקשב הרגיל לקח 35.12 ג'יגה בייט של זיכרון גרפי, אבל מעבר למנגנון הייעודי הוריד את צריכת הזיכרון ל־11.71 ג'יגה בייט בלבד, מה שמאפשר להריץ אותו בנוחות על כרטיס בודד מסוג RTX 4090 או כרטיסי שרת מסדרות Ampere, Hopper ו־Blackwell.

כרגע אין תמיכה ב־TensorRT או Triton, כך שהתשתית נשענת על פייתון נקי ודורשת תלויות ספציפיות כמו פלאש אטנשן לביצועים גבוהים. אם אין לכם חומרת אנבידיה ייעודית עם זיכרון גרפי פנוי, עדיף להשתמש ב־API חיצוני של מודל מולטימטודלי רחב ולא להסתבך עם התקנת מודולי קודה מקומיים.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="nvidia/LocateAnything-3B")
print(pipe("שלום"))

הרישיון

הרישיון שהוצמד כאן מיועד למחקר ולמטרות ללא כוונת רווח בלבד. שימוש מסחרי אסור לחלוטין, כך שאי אפשר לשלב את המשקולות האלה במוצר שנמכר ללקוחות או בשירות רווחי.

הרישיון המלא בעמוד המודל ↗