GPT
Q

Qwen-AgentWorld-35B-A3B

קוד פתוח

Qwenapache-2.02026-06-22

  • transformers
  • safetensors
  • qwen3_5_moe
  • image-text-to-text
  • qwen

יש כאן גם סקירה על Qwen עצמו.

סימולטור טקסטואלי שמנבא תגובות של מערכות הפעלה, דפדפנים וכלים עבור סוכנים אוטונומיים. הוא מאפשר לבחון סוכנים בלי לחבר אותם לתשתיות חיות ומסוכנות.

  • 35Bפרמטרים
  • 262,144טוקנים בהקשר
  • 64.6 GBמשקל הקבצים
  • 49,581הורדות בחודש

מה זה

במקום לתת לסוכן גישה ישירה למסוף לינוקס אמיתי, לאתר אינטרנט או למכשיר אנדרואיד, מריצים מולו את המודל הזה. הוא מקבל את הפעולה שהסוכן ביצע ומחזיר את הפלט הצפוי של המערכת, כולל נימוק ארוך של מעבר המצבים הפנימי. האימון שלו התמקד כולו במידול סביבות מקצה לקצה, החל משלב ה־CPT, ולא כתוספת מאוחרת למודל שיחה רגיל.

הוא מכסה שבעה תחומים שונים, מקריאות כלי MCP וחיפוש ועד מערכות הפעלה והנדסת תוכנה. במדד AgentWorldBench הוא מגיע לציון כולל של 56.39, ועוקף מודלים סגורים ענקיים כמו Gemini 3.1 Pro שעומד על 54.57. הוא חזק במיוחד במשימות הנדסת תוכנה עם ציון 65.63 ובדימוי מסוף עם 53.96, אבל בסביבות רשת הוא מתקשה יותר ומשיג 49.55 בלבד.

מתאים ל

  • סימולציית הרצת פקודות bash

    מייצר פלט מסוף מציאותי לסוכני קוד בלי לתת להם הרשאות ריצה על מכונה חיה.

  • אימון סוכנים בלולאה סגורה

    משמש כסביבת RL חיצונית להרצת איטרציות מרובות במהירות וללא תלות ברשת.

  • בדיקת ממשקי MCP וכלים

    בודק התנהגות של סוכן מול תגובות כלי מערכת מדומות בדיוק גבוה של 64.79 נקודות.

איפה זה נופל

המודל הזה לא נועד לענות על שאלות כלליות, לכתוב מאמרים או לנהל שיחות שירות, ואם תנסו להשתמש בו כצ'אטבוט רגיל תקבלו תוצאות עקומות. החולשה הבולטת ביותר שלו בבנצ'מרק היא תחום ה־Web, שבו הוא קיבל 49.55 בלבד, הציון הנמוך ביותר מבין כל שבעת התחומים. בנוסף, חלון ההקשר הענקי יחד עם פלט מומלץ של 32,768 טוקנים מייצר צריכת זיכרון חריפה שמקשה מאוד על חומרה צנועה.

שאלות
נפוצות

האם אפשר להריץ את המודל על כרטיס RTX 4090 בודד?

לא בפורמט המקורי. הקבצים שוקלים 64.6 ג'יגה־בייט, והרצה של חלון הקשר ארוך דורשת זיכרון רב נוסף ל־KV Cache. תיעוד המודל מציג הרצה על גבי ארבעה מעבדים גרפיים במקביל.

למה המודל מחזיר תגיות think לפני כל תשובה?

הוא מאומן לנמק את המצב הפנימי של הסביבה באמצעות שרשרת חשיבה ארוכה לפני שהוא מייצר את הפלט. זה חלק בלתי נפרד מדרך הפעולה שלו, ומאפשר לו לחזות שינויי מצב מורכבים במערכת ההפעלה.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־64.6 ג'יגה־בייט, אבל בזכות ארכיטקטורת MoE מופעלים רק 3 מיליארד פרמטרים מתוך 35 מיליארד בכל טוקן. המשמעות היא שזמן החישוב פר טוקן מהיר יחסית, אך עדיין חובה להחזיק את כל המשקולות בזיכרון. פקודות ההרצה הרשמיות דורשות פיצול לארבעה מאיצים גרפיים באמצעות vLLM או SGLang.

חלון ההקשר מגיע ל־262,144 טוקנים, והמפתחים ממליצים לא לרדת מ־128 אלף טוקנים כדי לא לפגוע בדיוק הסימולציה. ב־vLLM חובה להוסיף את הדגל language-model-only, אחרת המנוע מנסה לאתחל רכיבי ראייה שלא קיימים במשקולות ונכשל מיד.

from transformers import pipeline

pipe = pipeline("text-generation", model="Qwen/Qwen-AgentWorld-35B-A3B")
print(pipe("שלום"))

הרישיון

רישיון apache-2.0 פתוח ומתיר שימוש מסחרי מלא, שינוי של הקוד והפצה פנימית או חיצונית. מותר לשלב אותו במוצרים מסחריים בלי לשלם תמלוגים, בתנאי ששומרים על הודעות זכויות היוצרים וכתב הוויתור על אחריות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗