GPT
K

kosmos-2-patch14-224

קוד פתוח

microsoftmit2023-10-02

  • transformers
  • pytorch
  • safetensors
  • kosmos-2
  • image-text-to-text

microsoft עומדים גם מאחורי Sho, ויש עליו סקירה כאן.

זה מודל ראייה ושפה קטן שמחבר מילים למיקומים מדויקים בתמונה. הוא מתאים למי שרוצה לא רק תיאור כללי של פריים, אלא גם קואורדינטות של העצמים שמופיעים בו.

  • 1.7Bפרמטרים
  • 2,048טוקנים בהקשר
  • 12.4 GBמשקל הקבצים
  • 166,047הורדות בחודש

מה זה

המודל הזה מקבל תמונה וטקסט ומחזיר תשובה שמשלבת מילים יחד עם מיקומי תיחום. במקום לעצור ביצירת כיתוב רגיל, הוא מסמן את הישויות שהוא מדבר עליהן באמצעות טוקנים מיוחדים של מיקום, מה שמאפשר לחלץ נקודות חיתוך ישירות מהפלט. הוא נבנה עבור משימות של זיהוי עצמים לפי ביטוי, יצירת תיאורים ממוקדים לפי אזור מסוים, ומענה על שאלות שמצריך הצבעה על פריטים בתוך התמונה.

עם 1.7 מיליארד פרמטרים, המודל מתמקד ביכולת ההצבעה והקישור הזו. הוא פועל באמצעות הנחיות ייעודיות שכוללות תגיות כמו grounding ו־phrase, ומחזיר קואורדינטות יחסיות שניתן לצייר ישירות על התמונה המקורית.

מתאים ל

  • זיהוי ומיקום עצמים בטקסט

    הוא מזהה פריטים לפי תיאור מילולי חופשי ומחזיר את התיחום המדויק שלהם בתוך התמונה.

  • מענה על שאלות עם הצבעה

    הוא עונה על שאלות לגבי התמונה ומסמן במקביל איפה בדיוק נמצא המידע שעליו הסתמך.

  • תיאור אזור ספציפי בתמונה

    אתם שולחים קואורדינטות של שטח מסוים, והוא מייצר טקסט שמסביר מה נמצא בתוכו.

איפה זה נופל

המודל מוגבל לחלון הקשר של 2,048 טוקנים, מה שחוסם שיחות ארוכות או עיבוד טקסט מורכב סביב התמונה. הפורמט שלו תלוי לחלוטין בתבניות פרומפט קשיחות עם תגיות ייעודיות, ואם לא מקפידים עליהן בדיוק, הוא לא יחזיר את נתוני המיקום הנדרשים. בנוסף, מודל של 1.7 מיליארד פרמטרים עלול לפספס עצמים קטנים או להחזיר תיחום לא מדויק בתמונות עמוסות בפרטים.

שאלות
נפוצות

איך מחלצים את הריבועים של העצמים מהתשובה שלו?

הוא פולט תגיות מיוחדות בטקסט שמייצגות אינדקסים של טלאים בתמונה. הקוד של הספרייה ממיר את התגיות האלה לקואורדינטות רגילות, ואיתן אפשר לצייר את התיבות ישירות על הקובץ.

אפשר להשתמש בו כמו צ'אטבוט רגיל לתמונות?

הוא פחות מתאים לשיחה חופשית. הוא נבנה לעבוד עם הנחיות מובנות מאוד לצורך איתור וקישור של ישויות, וחלון ההקשר שלו מוגבל יחסית.

איך מריצים

המודל שוקל כ־12.4 גיגה בייט ומגיע בדיוק של float32, כך שכדי להעלות אותו לזיכרון כפי שהוא תצטרכו לפחות 16 גיגה בייט ב־GPU או ב־RAM של המחשב. הוא עובד דרך ספריית transformers הרגילה של פייתון ומשתמש בארכיטקטורה ייעודית בשם Kosmos2ForConditionalGeneration.

אם אין לכם כרטיס מסך מתאים עם מספיק זיכרון להחזיק את הקבצים הגדולים, תתקשו להריץ אותו מקומית בקצב סביר. במקרים של עומס נקודתי או שרתים קטנים, פתרון ענן או קריאה מרוחקת יהיו נוחים יותר מלהחזיק חומרה ייעודית למשקל הזה.

from transformers import pipeline

pipe = pipeline("image-to-text", model="microsoft/kosmos-2-patch14-224")
print(pipe("שלום"))

הרישיון

הרישיון כאן הוא MIT, שזה הרישיון הכי פתוח שיש. מותר להשתמש בו למוצרים מסחריים, לשנות את הקוד, להפיץ אותו מחדש ולשלב אותו במערכות פנימיות בלי לשלם תמלוגים. התנאי היחיד הוא שמירת הודעת זכויות היוצרים והרישיון המקורי בקוד שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗