GPT
T

Trinity-Mini

קוד פתוח

arcee-aiother2025-12-01

  • transformers
  • safetensors
  • afmoe
  • text-generation
  • conversational

מודל תערובת מומחים של עשרים ושישה מיליארד פרמטרים שדורש בפועל רק שלושה מיליארד פעילים בכל ריצה. הוא מכוון למשימות היגיון וקוד עם זיכרון עבודה רחב במיוחד.

  • 26Bפרמטרים
  • 131,072טוקנים בהקשר
  • 48.7 GBמשקל הקבצים
  • 20,900הורדות בחודש

מה זה

מדובר במודל שמבוסס על ארכיטקטורת תערובת מומחים עם מאה עשרים ושמונה מומחים בסך הכול, כאשר בכל טוקן פעילים שמונה מומחים ומומחה משותף אחד. השילוב הזה נותן נפח ידע של מודל בינוני, אבל שומר על מהירות חישוב ועלויות עיבוד של מודל קטן עם שלושה מיליארד פרמטרים פעילים בלבד. הוא אומן על עשרה טריליון טוקנים עם דגש על מתמטיקה ותכנות, ומכוון לפתרון בעיות והיגיון בלי לנפח את כמות הטוקנים בתשובה בהשוואה למודלי הוראות רגילים.

היתרון המרכזי כאן מול מודלים צפופים רגילים הוא חלון הקשר של מאה עשרים ושמונה אלף טוקנים, שמאפשר להזין תיעוד טכני נרחב, קבצי קוד שלמים או היסטוריית שיחה ארוכה. לפי המפרט, התמיכה בשפות כוללת אנגלית, ספרדית, צרפתית, גרמנית, איטלקית, פורטוגזית, רוסית וערבית, כך שעברית כלל לא נמצאת ברשימת השפות הנתמכות ומחייבת בדיקה עצמאית לפני שבונים עליו.

מתאים ל

  • ניתוח קוד ומאגרים

    אימון ייעודי על מתמטיקה וקוד יחד עם חלון עבודה של 128k טוקנים מתאימים לבדיקת קבצים גדולים.

  • הפעלת כלים וסוכנים

    תמיכה מובנית ב־vLLM בחילוץ קריאות כלים ועיבוד מסלולי היגיון עבור סוכני תוכנה.

  • שרת היסק חסכוני

    רק שלושה מיליארד פרמטרים פעילים מאפשרים מהירות תגובה גבוהה יותר ממודל צפוף בגודל מלא.

איפה זה נופל

החיסרון הכי בולט עבור משתמשים ישראלים הוא היעדר תמיכה רשמית בעברית, כאשר רשימת השפות עוצרת בערבית ובשפות אירופאיות. בנוסף, מודל MoE דורש לטעון את כל 48.7 הגיגה בייט של המשקולות לזיכרון גם אם רק חלק קטן מהם פעיל בכל רגע, ולכן אין כאן חיסרון בנפח ה־VRAM אלא רק בחישוב. לפני שמכניסים אותו למערכת פעילה, חובה לבדוק התנהגות עם קוד מרוחק ולוודא שהתשובות בשפות שאינן אנגלית לא נשברות תחת עומס.

אותה משפחה

Trinity-Mini יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בעברית לפיתוח יישומים מקומיים?

הכרטיס מפרט תמיכה בשמונה שפות בלבד, כולל אנגלית, רוסית וערבית, אך עברית אינה ברשימה. לא הייתי בונה עליו עבור שירות מבוסס עברית בלי לבצע קודם בדיקות מקיפות על איכות הטקסט והיכולת להבין הוראות.

כמה זיכרון בפועל צריך כדי להריץ אותו במחשב מקומי?

המשקל הכולל של הקבצים מגיע ל־48.7 גיגה בייט, ולכן הרצה ב־bfloat16 דורשת מעל 50 גיגה בייט זיכרון. אם משתמשים בקוונטיזציה של llama.cpp כמו q4_k_m, אפשר להסתפק בחומרה שולחנית עם פחות זיכרון.

איך מריצים

כדי להריץ אותו במשקל מלא של bfloat16 תצטרכו כמעט חמישים גיגה בייט של זיכרון וידאו, מה שאומר לפחות שני כרטיסים של עשרים וארבעה גיגה בייט או כרטיס שרת בודד. אפשר להריץ אותו מקומית דרך vLLM בגרסה 0.11.1 ומעלה עם הגדרות מובנות לקריאות כלים ועיבוד היגיון, או לחלופין לפנות לגרסאות מקוונטטות בפורמט GGUF דרך llama.cpp ו־LM Studio שחוסכות בזיכרון ומאפשרות הרצה על חומרה צנועה בהרבה.

אם אתם לא רוצים להחזיק שרת ייעודי, לנהל מפתחות קוד מותאמים אישית עם trust remote code בספריית transformers, או להסתבך עם פריסה מקומית כבדה, הוא זמין לשימוש ישיר דרך ה־API של OpenRouter, מה שחוסך את כל כאב הראש של התשתית.

from transformers import pipeline

pipe = pipeline("text-generation", model="arcee-ai/Trinity-Mini")
print(pipe("שלום"))

הרישיון

הוא מופץ תחת רישיון שנקרא OpenMDW-1.1, שמוגדר במערכת כרישיון מסוג other ולא כאחד הרישיונות הפתוחים המוכרים דוגמת אפאצ׳י או MIT. המשמעות היא שחובה לקרוא בעיון את נוסח הרישיון המלא של Arcee AI לפני שמשלבים אותו במוצר מסחרי, כדי לוודא שאין בו מגבלות הפצה, שימוש חוזר או תנאים מסחריים ספציפיים.

הרישיון המלא בעמוד המודל ↗