GPT
L

LocateAnything-3B-GGUF

קוד פתוח

yuuko-ethother2026-06-03

  • gguf
  • nvidia
  • eagle
  • vision
  • object-detection

המודל הזה מקבל תמונה והוראה טקסטואלית, ומחזיר קואורדינטות מדויקות של האלמנטים המבוקשים. הוא מציע יכולות איתור מגוונות בגודל קומפקטי שמתאים לחומרה מקומית צנועה.

  • 17.4 GBמשקל הקבצים
  • 5,433הורדות בחודש
  • 37לייקים

מה זה

הארכיטקטורה משלבת מקודד תמונה מסוג MoonViT, מקרן של Eagle ומודל שפה של Qwen2.5 בנפח של 3 מיליארד פרמטרים. במקום להתעסק בשיחה פתוחה, הוא מתמקד בזיהוי מיקומים במרחב התמונה, בין אם מדובר באיתור אובייקטים לפי תיאור חופשי, קריאת מיקומי טקסט ורכיבי ממשק משתמש, או החזרת נקודות ציון בודדות.

החידוש המרכזי כאן הוא מנגנון שמפענח את כל קואורדינטות התיבה במקביל במקום לייצר טוקן אחרי טוקן, מה שמאיץ את הפעולה עד פי שניים וחצי ביחס לגישות קודמות. הפלט מוחזר כטוקנים ייעודיים של תיבות או נקודות שמנורמלות לטווח שבין אפס לאלף, כך שהאינטגרציה לצורכי אוטומציה ישירה יחסית.

מתאים ל

  • אוטומציה של ממשקי משתמש

    זיהוי כפתורים ואלמנטים במסך בדיוק תת־פיקסלי לצורך הפעלת סוכנים אוטונומיים.

  • תיוג דאטה אוטומטי

    יצירת תיבות תוחמות ונקודות ציון מקומיות לתמונות לפי הנחיות טקסטואליות.

  • איתור טקסט ומבנה במסמכים

    שליפת מיקומים מדויקים של פסקאות, כותרות או שדות טקסט בתוך דפים סרוקים.

איפה זה נופל

המודל אינו כולל גרסאות בכימות נמוך במיוחד כמו IQ2 מפני שכימות כזה פוגע ישירות בדיוק הקואורדינטות. שרת ה־llama-server נבדק לתמונה בודדת ולשאילתה יחידה, ללא תמיכה מאומתת בעיבוד אצוות של מספר תמונות במקביל. ישנם גם מקרים שבהם תשתיות עיבוד של פלאש אטנשן נכשלות בגלל גודל הממדים של רכיב התמונה, מה שמחייב ביטול ידני של ההאצה הזו.

שאלות
נפוצות

למה התשובה מהשרת מחזירה רק טקסט בלי קואורדינטות?

הקואורדינטות מיוצרות כטוקני בקרה מיוחדים. אם לא מפעילים את llama-server עם הדגל special, השרת מסנן אותם אוטומטית החוצה ומשאיר רק את התוויות הרגילות.

האם אפשר להשתמש בגרסת llama.cpp הרגילה שכבר מותקנת אצלי?

לא. התמיכה בארכיטקטורה המולטימודלית הזו עדיין לא מוזגת למאגר הראשי, ולכן חייבים לקמפל את הפורק הייעודי של המפתח.

איך מריצים

כדי להריץ אותו עם llama.cpp נדרש בילד מפורק ייעודי, כיוון שהתמיכה במנגנון המולטימודלי הזה טרם נכנסה לקוד הרשמי. חובה להוריד שני קבצים נפרדים, את מודל השפה המכומת ואת מקרן התמונה, ולהוסיף את הדגל special בהפעלת השרת כדי שהטוקנים של הקואורדינטות לא יימחקו מהפלט.

קובץ ה־Q4_K_M שוקל 2.1 גיגה בייט ומספק רמת דיוק תת־פיקסלית ביחס למקור, כך שכרטיס מסך בסיסי עם 6 עד 8 גיגה בייט זיכרון יחזיק אותו ואת המקרן בלי בעיה. כדאי להגביל את הצד הארוך של התמונה ל־1280 פיקסלים כדי לקצר את שלב עיבוד התמונה למתחת לשנייה.

ollama run hf.co/yuuko-eth/LocateAnything-3B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון של אנבידיה אוסר שימוש מסחרי מכל סוג ומאפשר שימוש למחקר ולמטרות ללא כוונת רווח בלבד. חברות או מפתחים שרוצים להטמיע את היכולות הללו במוצר מסחרי לא יכולים להשתמש בקבצים האלה כחוק.

הרישיון המלא בעמוד המודל ↗