GPT
F

Falcon-Perception

קוד פתוח

tiiuaeapache-2.02026-02-22

  • transformers
  • safetensors
  • falcon_perception
  • text-generation
  • falcon

חלופה קלה וישירה לסגמנטציה של עצמים בתמונה לפי טקסט חופשי, עם פחות ממיליארד פרמטרים שרצים בקלות על כרטיס גרפי ביתי בלי להסתבך עם פייפליין כבד.

  • 632Mפרמטרים
  • 8,192טוקנים בהקשר
  • 2.4 GBמשקל הקבצים
  • 8,626הורדות בחודש

מה זה

הארכיטקטורה הזו דוחסת תמונה וטקסט לתוך טרנספורמר יחיד בגודל 632 מיליון פרמטרים. במקום להפריד בין מודל שפה למודל ראייה, הוא מעבד את הטוקנים יחד, שולף נקודות עניין וגבולות, ויוצר מסיכות מדויקות ברמת הפיקסל ישירות מהטקסט שביקשתם, בלי צורך לחתוך מראש או להגדיר קטגוריות קבועות.

במבחני PBench הוא מציג תוצאות טובות בעצמים רגילים עם 63.7 נקודות F1, ובגרסת האימון עם חיזוקים מגיע ל־80.5 בסצנות צפופות. החוזק האמיתי שלו הוא ביכולת לזהות מאות אובייקטים באותה תמונה בלי מנגנוני סינון כפילויות חיצוניים, תחום שבו מודלים קלאסיים נוטים לפספס או לייצר המון כפילויות מיותרות.

מתאים ל

  • ספירת מלאי בצפיפות גבוהה

    מאתר ומסמן מאות פריטים קטנים באותה תמונה ברצף בלי להזדקק לשלבי סינון כפילויות ידניים.

  • סגמנטציה לפי הוראות טקסט

    מבודד מסיכות פיקסלים מדויקות של אובייקטים ספציפיים בעזרת תיאור מילולי פשוט.

  • פייפליין עיבוד תמונה מקומי

    רץ ישירות על חומרה מקומית צנועה ללא תלות בשרתי ענן חיצוניים או בעלויות קריאה לפי שימוש.

איפה זה נופל

הבעיה העיקרית היא כיול נוכחות, כלומר הוא נוטה לפלוט מסיכות גם כשמה שחיפשתם בכלל לא מופיע בתמונה, מה שמייצר זיהויים שגויים בקלות יחסית למודלים כמו SAM 3. בנוסף, זיהוי מבוסס טקסט בתוך תמונה חלש מאוד ועומד על 38.3 נקודות F1 בלבד, כך שאם הטקסט קטן, מטושטש או סרוק באיכות ירודה, הוא פשוט יפספס אותו.

שאלות
נפוצות

האם המודל יודע לנהל שיחה או להסביר מה מופיע בתמונה?

לא. הוא לא מיועד לשיחה, לניתוח טקסטואלי ארוך או למענה על שאלות פתוחות. התפקיד היחיד שלו הוא לקבל תיאור קצר ולהחזיר קואורדינטות ומסיכות חיתוך של האובייקטים המבוקשים.

איך המודל מתמודד עם תמונות ברזולוציה נמוכה?

הוא עשוי לזהות שהאובייקט קיים בתמונה, אבל יתקשה מאוד למקם את הגבולות שלו במדויק. בסצנות צפופות או מורכבות, חובה לספק תמונה ברזולוציה טובה כדי לקבל מסיכות ברורות.

איך מריצים

מריצים אותו דרך transformers ישירות עם PyTorch 2.5 ומעלה, כי הוא דורש FlexAttention כדי לעבוד. הקבצים שוקלים 2.4 גיגה בייט בלבד, כך שכרטיס מסך בודד עם 8 עד 12 גיגה זיכרון מספיק לגמרי כדי להעלות אותו בבת אחת ולעבוד מקומית.

אם יש לכם תמונות עמוסות עם מאות פריטים, עדיף למשוך את הגרסה שעברה אימון חיזוקים בריוויז'ן של אוגוסט 2026, שפותרת את הצורך בסילוק כפילויות ידני. הקריאה הראשונה לוקחת כמה שניות בגלל קומפילציה פנימית, אבל אחר כך הריצה מהירה.

from transformers import pipeline

pipe = pipeline("mask-generation", model="tiiuae/Falcon-Perception")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache 2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו בתוך מוצרים סגורים בלי תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים המקורית והצהרת הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗