GPT
A

Agents-A1-4B

קוד פתוח

InternScienceapache-2.02026-07-13

  • transformers
  • safetensors
  • qwen3_5
  • image-text-to-text
  • vlm

המודל הזה מביא יכולות של סוכן אוטונומי ופירוק משימות מורכבות למשקל נוצה של 4.5 מיליארד פרמטרים. הוא מיועד למי שרוצה להריץ קריאות לכלים וחיפוש מתקדם מקומית בלי לתחזק שרת ענק.

  • 4.5Bפרמטרים
  • 262,144טוקנים בהקשר
  • 8.5 GBמשקל הקבצים
  • 324,134הורדות בחודש

מה זה

הארכיטקטורה מבוססת על Qwen3.5 ומכוונת באופן מובהק לתהליכי עבודה ארוכים של סוכנים, כמו תכנון שלבים, הרצת כלים חיצוניים ומעקב אחרי תוצאות ביניים. המפתחים אימנו אותו בשיטת זיקוק ידע מכמה מודלים מומחים במקביל, כדי להעביר יכולות של מערכות ענק אל תוך משקל קומפקטי של 8.5 גיגה בייט בלבד.

במבחנים שמודדים עבודה רב שלבית כמו GAIA הוא מציג ציון של 95.1 מול 58.3 של מודל הבסיס בגודל הזה, ובמשימות שימוש בכלים כמו MatTools הוא מזנק ל־49.3 לעומת 10.9. המשמעות היא לא שהוא כותב טקסטים יפה יותר, אלא שהוא יודע להחזיק תהליך, לתקן את עצמו מול תשובות של API ולא ללכת לאיבוד אחרי שני צעדים ראשונים. במבחני מעקב אחרי הוראות מורכבות עם תנאים מרובים הוא מגיע ל־94.8 ב־IFEval, מספר שמיישר קו עם מערכות גדולות בהרבה.

מתאים ל

  • סוכן מקומי להפעלת כלים

    אינטגרציה ל־API וקריאה לפונקציות ברשת הפנימית בלי להוציא נתונים החוצה, תודות לדיוק של 49.3 ב־MatTools.

  • עוזר מחקר עם חיפוש ארוך

    פירוק שאלות מורכבות להרבה שאילתות חיפוש עוקבות והסקת מסקנות, עם ציון 66.8 במבחן BrowseComp.

  • מעקב אחר הוראות מרובות תנאים

    סינון ועיבוד נתונים לפי רשימת חוקים נוקשה ללא סטיות, על בסיס ציון 94.8 במדד IFEval.

איפה זה נופל

במשימות של הנדסת תוכנה וכתיבת קוד מלאה הוא עדיין קטן. ב־LiveCodeBench הוא מגיע ל־59.6, תוצאה נמוכה משמעותית ממודלי תערובת מומחים שמגרדים שם את ה־78, וב־SciCode הוא נעצר על 29.6 בלבד. מעבר לזה, הכרטיס לא מציין אף מילה על תמיכה בשפות שאינן אנגלית או על יכולות בעברית, כך שאי אפשר להסתמך עליו בעיבוד טקסט מקומי בלי בדיקה יסודית מראש.

אותה משפחה

Agents-A1 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

איך אפשר לנצל חלון של 262 אלף טוקנים על כרטיס ביתי?

המשקלים עצמם שוקלים 8.5 גיגה בייט ונטענים בקלות, אבל הקשר ארוך של מאות אלפי טוקנים ידרוש עשרות גיגה בייטים נוספים של VRAM רק עבור ה־KV cache. בכרטיס ביתי רגיל תצטרכו להגביל את אורך ההקשר בפועל דרך מנוע ההרצה, או לעבור לגרסאות מכווצות מבוססות MLX או קוונטיזציה.

האם הוא מתאים לשמש כמודל לכתיבת קוד?

לא כמפתח עצמאי. הנתונים מראים שבמשימות קידוד טהורות כמו LiveCodeBench הוא מפגר בפער ברור מאחורי מודלים מתמחים וגדולים יותר. הוא מתאים בעיקר להפעלת סקריפטים וכלים כחלק מתהליך עבודה, ולא ליצירת קוד מורכב מאפס.

איך מריצים

המשקל דורש כרטיס מסך בודד, אבל חלון ההקשר המלא של 262,144 טוקנים ישתה זיכרון במהירות ברגע שה־KV cache יגדל. מריצים אותו ישירות דרך vLLM או SGLang עם פרמטר מקביליות 1, כשמומלץ להגדיר מפענח ייעודי לקריאות כלים כמו qwen3_coder כדי לקבל פלט יציב. אם המטרה היא רק טקסט, אפשר להפעיל דגל ייעודי שעוקף רכיבי ראייה וחוסך משאבים.

גרסאות מכווצות זמינות דרך הקהילה, כולל התאמות ל־Mac עם MLX, מה שמאפשר לבדוק אותו על לפטופ פיתוח רגיל. אם אתם לא צריכים פרטיות מקומית מוחלטת או שאין לכם כרטיס עם מספיק VRAM להחזיק הקשרים ארוכים באמת, קריאה ל־API של מודל גדול ומנוהל תחסוך את כאב הראש של ניהול הזיכרון.

from transformers import pipeline

pipe = pipeline("text-generation", model="InternScience/Agents-A1-4B")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache 2.0 מלא, מה שמאפשר שימוש מסחרי חופשי לחלוטין. מותר לשלב את המשקלים במוצר סגור, לשנות את הקוד ולהפיץ אותו, כל עוד שומרים על הודעות זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗