GPT
T

Trinity-Large-Thinking

קוד פתוח

arcee-aiother2026-04-01

  • transformers
  • safetensors
  • afmoe
  • text-generation
  • reasoning

מודל ענק שמיועד להריץ סוכנים אוטונומיים עם שרשראות חשיבה מפורטות. הוא מחזיר שלבי מחשבה מובנים בנפרד לפני הפעלת כלים, כדי לפתור משימות מורכבות ברצף.

  • 399Bפרמטרים
  • 262,144טוקנים בהקשר
  • 743 GBמשקל הקבצים
  • 3,978הורדות בחודש

מה זה

מדובר במודל שמבוסס על ארכיטקטורת תערובת מומחים דלילה. מתוך 399 מיליארד פרמטרים בסך הכל, רק כ־13 מיליארד פעילים בכל טוקן, מה שמקצר את זמן החישוב אבל משאיר את דרישות הזיכרון גבוהות מאוד. הוא מגיע מאומן מראש על 17 טריליון טוקנים ועבר כוונון ייעודי לסוכנים, תכנון רב שלבי וקריאה לכלים באמצעות למידת חיזוק.

המבנה שלו מפיק עקבות חשיבה גלויים בתוך תגיות ייעודיות לפני שהוא מייצר פלט סופי או קורא לפונקציה. במבחני ביצועים שמודדים עבודה רב שלבית של סוכנים, כמו טאו בריבוע ופינץ' בנץ', הוא מציג תוצאות גבוהות של 94.7% ו־91.9%, ועוקף מודלים סגורים וחזקים בכמה תרחישים מעשיים של הפעלת כלים.

בניגוד לגרסת התצוגה המקדימה הרגילה של אותה משפחה שמחזירה תשובות ישירות, כאן מנוע ההיגיון עובד בצורה מלאה בכל פנייה. הוא משתלב ישירות בתשתיות כמו אופן קלאו והרמס אייג'נט בלי צורך בהתאמות מיוחדות של הפרומפט.

מתאים ל

  • סוכן אוטונומי לניהול משימות

    הוא מתוכנן מראש לקרוא לכלים חיצוניים ולשמור על שרשרת ההיגיון לאורך שלבים מרובים.

  • פתרון בעיות מתמטיות

    שרשרת החשיבה הארוכה מביאה אותו לתוצאה של 96.3% במבחן AIME25.

  • אינטגרציה עם OpenClaw

    הארכיטקטורה שלו נבדקה מול התשתית הזו ועובדת מולה ללא צורך בהתאמות מיוחדות.

איפה זה נופל

החיסרון הכי בולט הוא ההכרח לשמור את כל טוקני החשיבה בהיסטוריית השיחה. אם המערכת שלכם תשמיט את שדה החשיבה בין סיבובים בלולאת סוכן, המודל מאבד את ההקשר ומתחיל לפלוט קריאות כלים שבורות, למשל תחביר שמופיע כטקסט במקום מבנה נתונים תקין. בנוסף, רשימת השפות הנתמכות כוללת אנגלית, ערבית, ספרדית, צרפתית, גרמנית, איטלקית, פורטוגזית ורוסית. עברית לא מופיעה שם, כך שלא הייתי בונה עליו לפעולות מורכבות בשפה המקומית. במבחני תכנות כלליים כמו SWE-bench Verified הוא קיבל 63.2%, פחות ממתחרים מובילים באותו סדר גודל.

אותה משפחה

Trinity-Large יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להסיר את בלוק החשיבה כדי לחסוך מקום בהקשר?

לא, זה שובר את המודל. היצרן מבהיר במפורש שבשיחות מרובות שלבים חובה להחזיר את תוכן החשיבה כחלק מההיסטוריה, אחרת המודל מייצר קריאות כלים פגומות.

כמה זיכרון וידאו בפועל צריך כדי להרים אותו?

הקבצים עצמם שוקלים 743 גיגה בייט. בשביל להריץ אותו בצורה יציבה בפורמט המקורי צריך לפחות 800 עד 900 גיגה בייט של VRAM, מה שמחייב קלאסטר שרתים עם שמונה כרטיסים מקצועיים לפחות.

איך מריצים

קובצי המודל תופסים 743 גיגה בייט ומחולקים ל־48 קבצים, כך שאי אפשר להריץ אותו על שרת בודד פשוט. כדי לטעון אותו במשקל מלא של bfloat16 תצטרכו קלאסטר עם מספר כרטיסי GPU חזקים מאוד שמספקים מעל 800 גיגה בייט של זיכרון וידאו, תוך שימוש במקביליות מומחים ב־vLLM.

אם אין לכם תשתית ענן ייעודית ותקציב חומרה כבד, עדיף בהרבה להשתמש בו דרך נקודת הקצה ב־OpenRouter או בממשק של Arcee. הרצה עצמית שווה את הטרחה רק אם החוק או אבטחת המידע מחייבים שהמידע לא ייצא מהשרתים המקומיים שלכם.

from transformers import pipeline

pipe = pipeline("text-generation", model="arcee-ai/Trinity-Large-Thinking")
print(pipe("שלום"))

הקבצים

48 קבצים במאגר, 743 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הקוד והמשקלים שוחררו תחת רישיון שנקרא OpenMDW בגרסה 1.1. לא מדובר ברישיון קוד פתוח סטנדרטי ומוכר, ולכן חברות שרוצות לשלב אותו במוצר מסחרי צריכות לבדוק את התנאים המשפטיים המדויקים של המסמך הזה לפני פריסה.

הרישיון המלא בעמוד המודל ↗