GPT
A

Agents-A1-4B-Q8_0-GGUF

קוד פתוח

InternScienceapache-2.02026-07-13

  • transformers
  • gguf
  • quantized
  • vlm
  • vision

גרסה מכווצת ברמת שמונה ביט של מודל סוכנים קטן, שמתמחה בריצות ארוכות, קריאות לכלים ופירוק משימות מורכבות.

  • 4.8 GBמשקל הקבצים
  • 216,912הורדות בחודש
  • 46לייקים

מה זה

מדובר במודל צפוף של 4 מיליארד פרמטרים שפותח כדי לפתור תהליכים מרובי שלבים, תחום שבו מודלים קטנים בדרך כלל מאבדים כיוון אחרי שתי איטרציות. המפתחים אימנו אותו בשיטה תלת שלבית עם זיקוק ממודלים מומחים ואימות פעולות מובנה, במטרה לשפר יכולות מחקר, שימוש בכלים וכתיבת קוד.

התוצאות במבחנים מראות פער ברור מול מודלים אחרים בסדר הגודל הזה. בחיפוש מורכב ברשת הוא קיבל ציון 66.8 במבחן BrowseComp לעומת 47.2 של מתחרה מקביל, ובמבחן GAIA הגיע ל־95.1 מול 58.3. במבחני מעבדה מדעיים וקריאות לפונקציות הוא עוקף לפעמים גם מודלים מבוססי תערובת מומחים גדולים בהרבה, מה שהופך אותו לבסיס מעניין לסוכנים עצמאיים.

מתאים ל

  • סוכן חיפוש וסיכום רשת

    ניווט במספר מקורות ואימות מידע, תחום שבו הוא השיג ציון של 66.8 במבחן BrowseComp.

  • אוטומציה של קריאות API

    פירוק בקשות של משתמש והפעלת פונקציות חיצוניות לפי פורמט מוגדר מראש.

  • סייען מחקר מקומי ופרטי

    ניתוח מסמכים טכניים ומדעיים על חומרה מקומית צנועה ללא הוצאת נתונים החוצה.

איפה זה נופל

מודל בגודל 4 מיליארד פרמטרים עדיין מוגבל בכוח החישוב הבסיסי שלו. במבחן LiveCodeBench-V6 הוא קיבל ציון 59.6, נמוך משמעותית מהאח הגדול שלו בסדרה שהגיע ל־76.2. הוא מתקשה יותר במשימות תכנות טהורות שדורשות אלגוריתמיקה כבדה.

בנוסף, הכרטיס אינו כולל שום מידע או מדידה על ביצועים בעברית. לפני שמשלבים אותו במערכת מקומית, חייבים לבדוק אם הוא מצליח להפעיל כלים ולקרוא הנחיות מורכבות בעברית בלי לשבור את המבנה או לאבד את ההקשר.

שאלות
נפוצות

כמה זיכרון דרוש כדי לנצל את כל חלון ההקשר?

המודל עצמו תופס פחות מ־5 ג'יגה בייט בזיכרון, אבל חלון של 262 אלף טוקנים יצרוך כמות גדולה בהרבה של זיכרון עבודה עבור ההקשר הפעיל. בחומרה מוגבלת עדיף להגביל את אורך ההקשר בהגדרות ההרצה לגודל שמתאים למשימה בפועל.

האם המודל מתאים לייצור בתור שירות צ'אט רגיל?

הוא נבנה ומכוון בעיקר למשימות של סוכנים, שימוש בכלים ופירוק שלבים. לשיחה רגילה מודלים ייעודיים לשיחה יתנו תוצאות טובות יותר באותו גודל.

איך מריצים

המשקל הכולל של הקבצים בגרסה הזו עומד על 4.8 ג'יגה בייט בפורמט GGUF, כך שהוא יושב בנוחות בזיכרון של כרטיס גרפי פשוט עם 6 עד 8 ג'יגה VRAM, או ישירות על הזיכרון של מחשבי אפל עם מעבדי סדרת אם. המודל תומך בחלון הקשר ענקי של 262,144 טוקנים, אבל ניצול מלא של החלון הזה ידרוש הרבה יותר זיכרון עבור ה־KV cache לעומת הטעינה הבסיסית של המשקלים.

להרצה מקומית בשרת המפתחים ממליצים על vLLM או SGLang עם מפענחי qwen3 להסקה ו־qwen3_coder לכלים, לצד פרמטרים ייעודיים כמו טמפרטורה 0.85 וקנס נוכחות של 1.1. אם אין לכם כרטיס גרפי תואם או שהמטרה היא רק ניסוח טקסט פשוט ומהיר, עדיף להשתמש ב־API חיצוני של מודל כללי במקום להסתבך עם הגדרות סביבה.

ollama run hf.co/InternScience/Agents-A1-4B-Q8_0-GGUF:Q8_0

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא Apache 2.0. זהו רישיון קוד פתוח מתירני מאוד שמאפשר שימוש מסחרי חופשי, שינוי של המשקלים, הפצה ושילוב בתוך מוצרים סגורים. התנאים העיקריים הם שמירת הודעת זכויות היוצרים וצירוף עותק של הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗