GPT
H

Holo1-7B

קוד פתוח

Hcompanyapache-2.02025-05-20

  • transformers
  • safetensors
  • qwen2_5_vl
  • image-text-to-text
  • multimodal

זה מודל ראייה ושפה שמיועד להפעיל ממשקי אתרים כמו בן אדם, על בסיס צילומי מסך והחזרת קואורדינטות לחיצה מדויקות. הוא מציע חלופה פתוחה וזולה למודלים מסחריים גדולים במשימות אוטומציה בדפדפן.

  • 8.3Bפרמטרים
  • 128,000טוקנים בהקשר
  • 15.5 GBמשקל הקבצים
  • 229הורדות בחודש

מה זה

מדובר במודל שמבוסס על כוונון של Qwen2.5-VL-7B-Instruct, שנבנה במיוחד כדי לשמש כרכיב תכנון, איתור אלמנטים ובקרה בתוך סוכני רשת. בניגוד למודלי תמונה וטקסט כלליים שמחזירים בעיקר תיאורים מילוליים, הוא הותאם לפלוט ישירות מבני נתונים של פעולות בדפדפן, מחשבות של הסוכן ונקודות לחיצה מוגדרות בפיקסלים.

היתרון שלו נמדד בעיקר מול מודלים סגורים יקרים. במבחן WebVoyager שכולל מאות משימות גלישה אמיתיות, הוא הגיע לדיוק של 92.2 אחוזים בעלות מדווחת של 0.13 דולר למשימה, תוצאה שמקבילה לביצועים של GPT-4.1 שעמד על 92.0 אחוזים אבל עלה 0.54 דולר למשימה. הוא נבדק גם בשורה של מבחני זיהוי ממשק כמו Screenspot ו־GroundUI-Web כדי לוודא פגיעה מדויקת באלמנטים גרפיים.

מתאים ל

  • סוכן בדיקות ממשק

    הוא מזהה שדות וכפתורים לפי תמונה בלבד ומחזיר נקודות לחיצה ללא תלות ב־DOM של האתר.

  • איסוף מידע מדפדפן

    מנווט בעצמו בין דפים וממלא טפסים כחלופה זולה למודלים מסחריים גדולים.

  • איתור אלמנטים גרפיים

    מחזיר מבנה נתונים מסודר עם מיקום הפיקסלים המדויק לכל רכיב שמופיע במסך.

איפה זה נופל

המודל פולט קואורדינטות בפיקסלים אבסולוטיים, מה שדורש טיפול ידני מקדים בהתאמת גודל התמונה לפי הפקדים של המעבד כדי שהלחיצה לא תחטיא. מעבר לזה, המודל אומן ותועד רק באנגלית, ולכן ממשקים בעברית או אתרים מקומיים עם כיווניות מימין לשמאל עשויים לבלבל אותו. הוא גם לא מיועד לשמש כמנוע שיחה כללי, אלא אך ורק כרכיב שמקבל משימה ומחזיר פעולה.

אותה משפחה

Holo1 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם הוא יעבוד טוב על אתרים בעברית?

הכרטיס מצהיר על תמיכה באנגלית בלבד. סביר שהוא יתקשה לקרוא טקסט בעברית על המסך או להתמודד עם פריסות מימין לשמאל, ולכן מומלץ לבדוק אותו על צילומי מסך מקומיים לפני שמסתמכים עליו.

למה צריך לשנות את גודל התמונה לפני השליחה אליו?

הוא מחזיר ערכי פיקסלים אבסולוטיים על בסיס הרזולוציה שמעבד התמונה של המודל מייצר. אם לא תשתמשו בפונקציית smart_resize לפי ההנחיות, נקודות הלחיצה שהוא יפלוט לא יתאימו לתמונה המקורית שלכם.

איך מריצים

המשקל הכולל של הקבצים עומד על 15.5 ג'יגה בפורמט bfloat16, כך שתצטרכו כרטיס מסך מודרני עם לפחות 16 עד 24 ג'יגה של זיכרון גרפי כדי לטעון אותו ישירות דרך ספריית transformers בלי כיווצים. אם הזיכרון גבולי, עדיף להמיר לקוונטיזציה או לפנות לשרת ייעודי.

מי שרק בודק את הרעיון של סוכן דפדפן ולא רוצה להרים תשתית מקומית יכול להשתמש בסביבות ההדגמה שהחברה העלתה, או לפנות למודלים סגורים דרך API. הרצה עצמית שווה את הטרחה כשיש נפח פעולות גבוה והתקציב לכל צעד ממשקי משחק תפקיד מכריע.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="Hcompany/Holo1-7B")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache 2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד והמשקלים ולהפיץ אותו כחלק ממוצר עצמאי. הדרישה העיקרית היא שמירה על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗