GPT
T

Trinity-Large-Preview

קוד פתוח

arcee-aiother2026-01-27

  • transformers
  • safetensors
  • afmoe
  • text-generation
  • conversational

מודל ענק שמפעיל רק 13 מיליארד פרמטרים לכל טוקן מתוך כמעט 400 מיליארד. הוא מאפשר מהירות חישוב גבוהה לצד קיבולת ידע רחבה וחלון הקשר עצום.

  • 399Bפרמטרים
  • 262,144טוקנים בהקשר
  • 743 GBמשקל הקבצים
  • 369הורדות בחודש

מה זה

הארכיטקטורה כאן מבוססת על מומחים דלילים עם 256 מומחים בסך הכול, כשבכל צעד ניתוב נבחרים רק ארבעה. הרעיון הזה שומר על עלות חישוב נמוכה יחסית בזמן היקש, כי המעבד בפועל רואה רק כמות קטנה של משקלים, למרות שהמודל כולו שומר ידע של מאות מיליארדים. הוא אומן על 17 טריליון טוקנים, וגרסת התצוגה המקדימה הזו עברה אימון הוראות נוסף על 20 מיליארד טוקנים.

במבחנים מול מודלים מתחרים באותו סדר גודל, הוא מציג יתרון מסוים במתמטיקה עם ציון של 24 ב־AIME 2025 ו־87.2 ב־MMLU. לעומת זאת, במשימות היגיון מורכבות יותר ובידע מדעי מתקדם כמו GPQA-Diamond ו־MMLU-Pro, הוא מפגר מאחור, מה שמראה שהכוח שלו מתרכז בעיקר בידע כללי רחב וחישובים מוגדרים.

מתאים ל

  • עיבוד מסמכים ארוכים

    חלון ההקשר העצום מאפשר לטעון קבצים שלמים וספריות קוד בלי לחתוך אותם מראש.

  • שרתי שיחה מהירים

    הפעלת 13 מיליארד פרמטרים בלבד בכל טוקן מאפשרת קצב הפקת מילים מהיר יחסית לגודלו.

  • פתרון בעיות חישוביות

    תוצאות המבחנים ב־AIME מראות יכולת טובה בניתוח שאלות מתמטיות.

איפה זה נופל

הגרסה הזו מוגדרת רשמית כתצוגה מקדימה שנמצאת בתהליך למידת חיזוק פעיל, ולא כמוצר סופי יציב. במבחני הבנה עמוקה ומדע היא מקבלת ציונים נמוכים יותר ממתחרות מקבילות. בנוסף, חלון ההקשר הורחב מ־8,192 טוקנים באימון המקורי עד לטווח של מאות אלפים, ולכן חשוב לבדוק אם הוא שומר על אחידות ואיכות כשהטקסט מתארך מאוד. עברית לא מופיעה ברשימת השפות הנתמכות בכרטיס.

אותה משפחה

Trinity-Large יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם כדאי להוריד ולהריץ אותו במחשב מקומי?

לא. משקל הקבצים לבדו עומד על מאות גיגה בייטים ודורש שרתים ייעודיים עם כמות גדולה של זיכרון גרפי. גם גרסאות מכווצות מיועדות לתחנות עבודה חזקות במיוחד, ולכן לבדיקות ראשוניות עדיף לפנות ל־API.

איך הוא מתפקד בעברית?

עברית אינה חלק מרשימת השפות הרשמית שמופיעה בפרטי המודל. סביר שהוא מסוגל לפלוט טקסט מסוים אם נתקל בו ברשת, אבל לא כדאי להסתמך עליו למשימות שדורשות דיוק לשוני בעברית.

מה ההבדל בין גרסה זו לגרסת ה־Thinking?

הגרסה הזו עברה כוונון בסיסי בלבד למענה להוראות, בעוד גרסת ה־Thinking אומנה לייצר שרשראות חשיבה מפורטות לפתרון בעיות היגיון מורכבות.

איך מריצים

במשקל של 743 גיגה בייט בפורמט המקורי, אי אפשר להריץ אותו על שרת בודד פשוט. צריך מקבץ שרתים עם כמה מאיצי שרתים כדי להחזיק את כל המשקלים בזיכרון, גם אם כמות הפרמטרים הפעילים בזמן ריצה קטנה. אפשר להפעיל אותו עם VLLM, Transformers עם קוד מרוחק, או דרך גרסאות מקווצות ב־llama.cpp.

אם אין לכם תשתיות שרתים כבדות או תקציב חומרה משמעותי, עדיף להשתמש בחיבור API דרך OpenRouter או לבדוק אותו בממשק הרשת שלהם. להרים אותו עצמאית שווה את ההשקעה רק כשאתם חייבים שליטה מוחלטת במידע הפרטי שלכם.

from transformers import pipeline

pipe = pipeline("text-generation", model="arcee-ai/Trinity-Large-Preview")
print(pipe("שלום"))

הקבצים

43 קבצים במאגר, 743 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל מופץ תחת רישיון שנקרא OpenMDW-1.1 ולא תחת רישיון קוד פתוח סטנדרטי רגיל. כדאי לקרוא היטב את תנאי הרישיון המקוריים לפני שילוב שלו במערכות מסחריות כדי לוודא שאין בו הגבלות שימוש, הפצה או דרישות גילוי.

הרישיון המלא בעמוד המודל ↗