GPT
B

bu-30b-a3b-preview

קוד פתוח

browser-useרישיון לא דווח2025-12-11

  • transformers
  • safetensors
  • qwen3_vl_moe
  • image-text-to-text
  • browser_use

מודל ראייה ושפה שמיועד להפעלת דפדפן אוטונומי, עם ארכיטקטורת מומחים שדורשת רק 3 מיליארד פרמטרים פעילים. הוא נבנה ישירות עבור ספריית browser-use.

  • 31Bפרמטרים
  • 262,144טוקנים בהקשר
  • 57.9 GBמשקל הקבצים
  • 2,303הורדות בחודש

מה זה

מדובר במודל שמבוסס על Qwen3-VL-30B-A3B-Instruct, ומטרתו העיקרית היא פעולה בתוך דפדפנים דרך ספריית הקוד הפתוח של browser-use. הוא משלב עיבוד תמונה וטקסט כדי לנתח מבנה של דפי אינטרנט, לקרוא את ה־DOM ולהבין צילומי מסך תוך כדי תנועה באתרים. בניגוד למודלים כלליים, האימון כאן התמקד בניווט, לחיצה על אלמנטים והבנה ויזואלית של ממשקים.

המבנה שלו הוא Mixture of Experts עם 31 מיליארד פרמטרים בסך הכול, אבל רק 3 מיליארד פרמטרים פעילים בכל רגע נתון. המשמעות היא שאתם מקבלים יכולת של מודל גדול יחסית, אבל זמני התגובה ועלויות החישוב בפועל דומים למודל קטן בהרבה, מה שקריטי כשמריצים סוכן שצריך לבצע עשרות פעולות ברצף.

מתאים ל

  • סוכני גלישה אוטונומיים

    הוא אומן במיוחד להשתלב עם ספריית browser-use לצורך ניווט, קריאת DOM ואיסוף מידע מאתרים.

  • ניתוח ויזואלי של אתרים

    הארכיטקטורה משלבת תמונה וטקסט ומאפשרת זיהוי אלמנטים גרפיים ומבניים בעמודי אינטרנט.

  • השוואת מידע ברשת

    יכולת מעקב אחר משימות רב שלביות ברשת, כמו בדיקת נתונים וספירת מדדים בין אתרים שונים.

איפה זה נופל

זהו שחרור מוקדם ומוגדר כגרסת תצוגה מקדימה, כך שאי אפשר לבנות עליו יציבות של מוצר סופי. בנוסף, המודל אומן ותועד רק בשפה האנגלית, ולכן ביצוע פעולות באתרים בעברית או הבנת ממשקים מקומיים כלל לא נבדקו ועלולים להיכשל.

נקודה בעייתית נוספת היא פער בהגדרות: המפרט הטכני מציין חלון הקשר ענק של מעל 262 אלף טוקנים, אך פקודת ההרצה הרשמית מגבילה את ההקשר ל־65,536 טוקנים בלבד, כנראה כדי לא לחנוק את החומרה.

שאלות
נפוצות

האם המודל יתמודד עם אתרים בעברית?

המודל מוגדר רשמית רק באנגלית ולא קיים תיעוד על אימון בשפות אחרות. סביר להניח שהוא יתקשה בזיהוי טקסט עברי ב־DOM או בהבנת צילומי מסך של אתרים מקומיים.

למה מודל של 3 מיליארד פרמטרים פעילים שוקל כמעט 58 גיגה בייט?

הוא משתמש בארכיטקטורת מומחים. יש לו 31 מיליארד פרמטרים בסך הכול שצריכים להישמר בזיכרון, אבל בכל שלב חישוב המודל מפעיל רק חלק קטן מהם כדי להאיץ את התגובה.

איך מריצים

המשקל הכולל של הקבצים עומד על כמעט 58 גיגה בייט. המפתחים ממליצים להרים אותו עצמאית דרך vLLM מגרסה 0.12.0 ומעלה, עם הגבלת אורך הקשר ל־65,536 טוקנים, מה שמאפשר לייצר שרת מקומי שתואם ל־API של OpenAI.

למרות שרק 3 מיליארד פרמטרים פעילים, כל 31 המיליארד חייבים לשבת בזיכרון של המאיץ הגרפי, כך שאי אפשר להריץ אותו על כרטיס ביתי פשוט. המפתחים מציינים שהוא יכול לשבת על GPU בודד, אבל מדובר בכרטיס עם זיכרון גדול מספיק להחזקת המשקלים. אם אין לכם חומרה ייעודית כזו, הם מציעים גישה ישירה דרך ה־Cloud API שלהם.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="browser-use/bu-30b-a3b-preview")
print(pipe("שלום"))

הרישיון

היוצרים לא דיווחו על רישיון שימוש בעמוד המודל. במצב כזה, מבחינה משפטית אין לכם אישור מוגדר להשתמש בו לצרכים מסחריים, להפיץ אותו או להטמיע אותו במוצר שלכם. כל עוד היוצרים לא יפרסמו רישיון ברור, מומלץ להגביל את השימוש בו לבדיקות פנימיות ומחקר בלבד.

הרישיון המלא בעמוד המודל ↗