GPT
M

matchanything_eloftr

קוד פתוח

zju-communityapache-2.02025-08-13

  • transformers
  • safetensors
  • efficientloftr
  • keypoint-matching
  • endpoints_compatible

התאמת נקודות מפתח בין תמונות מסוגים שונים, כמו צילום תרמי מול רגיל או סריקות רפואיות שונות, נשברת בדרך כלל. המודל הזה פותר בדיוק את זה באמצעות משקל קל של 16 מיליון פרמטרים.

  • 16Mפרמטרים
  • 61.3 MBמשקל הקבצים
  • 5,829הורדות בחודש
  • 84לייקים

מה זה

הארכיטקטורה כאן נשענת על EfficientLoFTR המוכר, אבל האימון שונה לגמרי. החוקרים באוניברסיטת זג'יאנג יצרו מאגר של כ־800 מיליון זוגות תמונות מגוונים שכללו מעברי סגנון סינתטיים, כמו יצירת הדמיות תרמיות ומפות עומק מתוך צילום רגיל. זה גרם למודל להתעלם משינויי מראה חיצוניים ולהתמקד במבנה הגיאומטרי העמוק של העצמים.

במקום להתאים מודל ייעודי לכל סוג חיישן, סט המשקלים הבודד הזה מדווח כבעל יכולת הכללה על פני יותר משמונה משימות שונות לחלוטין שלא נראו באימון. התוצאה היא כלי חצי־דחוס לרישום תמונות שיודע לחבר בין מקורות מידע שונים בלי צורך בכיול מחדש.

מתאים ל

  • רישום הדמיות רפואיות

    התאמת נקודות מדויקת בין סריקות שונות כמו CT מול MRI או דגימות רקמה בצביעות שונות ללא אימון מחדש.

  • שילוב מידע בחישה מרחוק

    חיבור תצלומי אוויר סטנדרטיים עם דימות מכ"ם SAR או צילום לוויין תרמי לצורך מעקב גיאוגרפי.

  • ניווט רובוטי ורחפנים

    הצלבת נתוני מצלמה תרמית בזמן אמת מול מפות וקטוריות או צילומי יום לצורך התמצאות בחשיכה.

איפה זה נופל

למרות ההבטחה להכללה רחבה, האימון התבסס בכבדות על נתונים סינתטיים ממודלים כמו CycleGAN ו־DepthAnything ולא על חיישני אמת בכל התחומים. בעולם האמיתי, רעש של מכשירי דימות רפואי או פערי רזולוציה קיצוניים בלוויינים מתנהגים אחרת מהדמיות. תצטרכו לבדוק את אחוז ההתאמות השגויות על הדאטה הספציפי שלכם לפני שאתם סומכים על התוצאות לניווט או רפואה.

שאלות
נפוצות

איך מתקינים את המודל בלי להיתקל בשגיאות טעינה?

הכרטיס מציין שהתמיכה מוזגה לענף main של transformers אך טרם יצאה בגרסה רשמית. חובה להתקין את הספרייה ישירות מכתובת הגיטהאב והקומיט שצוינו בתיעוד כדי שהמחלקות של המודל יזוהו.

האם המודל שומר על יכולות בהתאמת תמונות רגילות מאותו סוג?

כן, לפי המפתחים הוא שומר על ביצועים גבוהים גם במשימות מאותו סוג חיישן, למשל ברישום תמונות רשתית. מנגנון הליבה הוא עדיין ELOFTR ואינו מוגבל רק לחיישנים שונים.

איך מריצים

המשקל הכולל של הקבצים עומד על כ־61.3 מגה־בייט בלבד, כך שאין צורך במערך שרתים כבד. על כרטיס RTX 3090 בודד זוג תמונות ברזולוציה של 640 על 480 מעובד בתוך 40 אלפיות השנייה. מריצים אותו ישירות מתוך ספריית transformers, אך נכון לפרסום נדרשת התקנה ישירות מקומיט ספציפי של גיטהאב שבו שולב התיקון לקוד.

אין סיבה לשלם על קריאות לענן חיצוני עבור מודל קטן כל כך. כל כרטיס מסך ביתי סביר ואפילו מעבדים מודרניים יריצו אותו מקומית בלי לייצר צוואר בקבוק במערכת שלכם.

from transformers import pipeline

pipe = pipeline("text-generation", model="zju-community/matchanything_eloftr")
print(pipe("שלום"))

הקבצים

5 קבצים במאגר, 61.3 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

רישיון apache-2.0 מתיר שימוש מסחרי מלא, שינוי של הקוד והפצה פנימית או מסחרית במוצר שלכם. התנאי העיקרי הוא שמירת הודעת זכויות היוצרים והרישיון המקורי, לצד ציון שינויים שנעשו בקוד.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗