GPT
G

GELab-Zero-4B-preview

קוד פתוח

stepfun-aiapache-2.02025-11-28

  • transformers
  • safetensors
  • qwen3_vl
  • image-text-to-text
  • gui-agent

מודל ראייה ושפה קומפקטי שמיועד לפעול כסוכן עצמאי על ממשקי משתמש. הוא נבנה כדי לנווט באפליקציות, לזהות כפתורים ולבצע פעולות ישירות על מסכים מקומיים.

  • 4.4Bפרמטרים
  • 262,144טוקנים בהקשר
  • 8.3 GBמשקל הקבצים
  • 307הורדות בחודש

מה זה

מדובר במודל מבוסס ארכיטקטורת Qwen3VL שפותח כחלק מפרויקט GELab-Zero, ומטרתו העיקרית היא הפעלת ממשקים גרפיים. במקום להסתפק בתיאור תמונות, הוא מנתח צילומי מסך כדי להחליט על פעולות מעשיות כמו לחיצה, הקלדה, גלילה או המתנה, ומסוגל לנהל משימות מרובות שלבים באפליקציות שונות בלי צורך בהתאמה מוקדמת לכל אפליקציה.

הייחוד כאן הוא השילוב בין גודל צנוע של 4.4 מיליארד פרמטרים לבין חלון הקשר עצום של 262,144 טוקנים. זה אומר שאפשר להזין לו רצף ארוך מאוד של צילומי מסך והיסטוריית פעולות קודמות בלי לאבד את ההקשר של המשימה, דבר קריטי כשמנסים לבצע אוטומציה מורכבת במובייל או בדפדפן.

מתאים ל

  • אוטומציה לאפליקציות אנדרואיד

    הוא כולל תשתית מוכנה לחיבור ADB ומסוגל להקליק ולהקליד באפליקציות על סמך צילומי מסך.

  • בדיקות תוכנה וממשק משתמש

    מאפשר לבצע בדיקות קצה אל קצה של תרחישי משתמש מורכבים במכשיר מקומי בלי לשלוח מידע החוצה.

  • סוכן מקומי לפרטיות מירבית

    מתאים לסביבות עבודה מבודדות שבהן אסור להזרים תמונות מסך של משתמשים לשירותי ענן חיצוניים.

איפה זה נופל

המודל מוגדר כגרסת תצוגה מקדימה, מה שאומר שצריך לצפות לחוסר יציבות בהחלטות שלו. המגבלה המשמעותית ביותר לישראלים היא השפות, המודל אומן ותומך רשמית באנגלית ובסינית בלבד, כך שממשקים בעברית או טקסט מימין לשמאל כנראה ישבשו את זיהוי האלמנטים ויגרמו לפעולות שגויות. בנוסף, מודלים בגודל 4B עדיין נוטים לפספס כפתורים קטנים או לטעות במיקומי קואורדינטות בצפיפויות מסך גבוהות.

שאלות
נפוצות

האם אפשר להשתמש בו לאוטומציה של אפליקציות בעברית?

הכרטיס מצהיר על תמיכה באנגלית ובסינית בלבד. סביר להניח שהוא יתקשה לקרוא נכון ממשקים בעברית, לזהות כפתורים עם כיתוב מקומי או לדעת איפה להקליד כשהטקסט זורם מימין לשמאל.

האם חובה להשתמש ב־Ollama כדי להריץ אותו?

לא. Ollama היא רק הדרך המומלצת והמהירה בכרטיס המודל. מכיוון שמדובר בארכיטקטורת שנאים סטנדרטית של Qwen3VL, אפשר לטעון אותו גם ישירות דרך ספריית transformers בפייתון.

איך מריצים

המשקל הכולל של הקבצים עומד על 8.3 גיגה-בייט, מה שמאפשר להריץ אותו בנוחות על כרטיס מסך ביתי בודד עם 12 עד 16 גיגה זיכרון וידאו, או אפילו ישירות דרך מעבד ומערכת זיכרון משותפת בעזרת Ollama. התהליך דורש הורדה של הקבצים מיוזר האגינג פייס ובנייה מקומית של מודלפייל בתוך Ollama.

אם אתם מתכננים לשלוט במכשיר אנדרואיד אמיתי, המפתחים מספקים תשתית ייעודית שמתחברת לחיבורי ADB ומנהלת את ההקלטה והשידור החוזר של הפעולות. אין פה כרגע נקודת קצה מנוהלת בענן של היוצרים, כך שאם אין לכם חומרה להרצה מקומית, תצטרכו להרים שרת GPU משלכם.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="stepfun-ai/GELab-Zero-4B-preview")
print(pipe("שלום"))

הרישיון

המודל משוחרר תחת רישיון אפאצ'י שתיים אפס. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד והמשקלים, ולשלב אותו במוצרים סגורים בלי לשלם תמלוגים. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗