GPT
T

Trinity-Mini-GGUF

קוד פתוח

arcee-aiother2025-12-01

  • transformers
  • gguf
  • text-generation
  • en
  • es

ארכיטקטורת מומחים שמשלבת נפח של 26 מיליארד פרמטרים עם מהירות של מודל קטן. הוא מיועד למי שרוצה חשיבה אנליטית בלי לספוג את זמן הריצה של מודל ענק.

  • 342 GBמשקל הקבצים
  • 1,335הורדות בחודש
  • 62לייקים

מה זה

מדובר במודל מבוסס תערובת מומחים עם מאה עשרים ושמונה מומחים בסך הכול, כאשר בכל פעולה מופעלים שמונה מומחים בלבד ועוד אחד משותף. בפועל רק שלושה מיליארד פרמטרים פעילים בכל טוקן, כך שמקבלים מהירות חישוב של מודל קטן לצד קיבולת ידע של רשת גדולה.

הוא אומן על עשרה טריליון טוקנים עם דגש על מתמטיקה וקוד, ותומך בחלון הקשר של מאה עשרים ושמונה אלף טוקנים. לפי המפתחים הוא מכוון למשימות חשיבה, אך להבדיל ממודלים שמייצרים שרשראות חשיבה ארוכות שמנפחות את החשבון, הוא צורך כמות טוקנים דומה למודלי הוראות רגילים.

מתאים ל

  • פתרון בעיות קוד מקומי

    אימון ממוקד על קוד לצד הפעלה חסכונית של 3B פרמטרים נותנים מענה מהיר בתוך סביבת הפיתוח.

  • ניתוח מסמכים ארוכים

    תמיכה בחלון של 128k טוקנים מאפשרת לעבד קבצים ופרויקטים שלמים בלי לחתוך את הקלט.

  • משימות חשיבה וחישוב

    ביצועי חשיבה אנליטית שמפיקים תשובות קצרות בלי לנפח טוקנים של הסברים מיותרים.

איפה זה נופל

למרות שהוא אומן על שפות כמו אנגלית, ספרדית וערבית, עברית לא נכללת ברשימת השפות הנתמכות שלו. אם המערכת שלכם צריכה לנתח או לפלוט טקסטים בעברית, צפו להזיות, שיבושי תחביר וביצועים ירודים ביחס למודלים רב־לשוניים ייעודיים. בנוסף, מודלי מומחים נוטים לסבול מאיטיות ברגע שחלק מהמשקלים גולשים מחוץ לזיכרון הווידאו לזיכרון המערכת הרגיל.

אותה משפחה

Trinity-Mini יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל יעבוד טוב בעברית?

המודל לא הוכרז כתומך בעברית, והאימון שלו התמקד בשפות אחרות כמו אנגלית, ספרדית, ערבית ורוסית. כתיבה או קריאה של עברית תוביל לתוצאות פחות טובות ולא מומלץ להסתמך עליו בעיבוד שפה מקומי.

כמה זיכרון כרטיס מסך צריך כדי להריץ אותו?

כל 26 מיליארד הפרמטרים צריכים להיטען לזיכרון במלואם, גם אם רק חלקם פועלים בכל רגע נתון. בגרסת קוונטיזציה ממוצעת של 4 ביט תצטרכו כרטיס מסך עם לפחות 16 עד 20 גיגה־בייט זיכרון כדי להריץ אותו בצורה חלקה.

איך מריצים

כדי להריץ אותו מקומית צריך גרסה מעודכנת של llama.cpp החל מבילד 7061, או את הגרסה האחרונה של LM Studio. המפתחים ממליצים להגדיר טמפרטורה נמוכה של 0.15, לצד top-p של 0.75 וערך min-p של 0.06 כדי לקבל תוצאות מדויקות.

אף על פי שבזמן הריצה מופעלים רק שלושה מיליארד פרמטרים, כל עשרים ושישה המיליארדים חייבים לשבת בזיכרון. זה אומר שתצטרכו כרטיס מסך עם זיכרון וידאו שמחזיק את הקוונטיזציה שבחרתם, למשל גרסת q4_k_m. אם אין לכם חומרה ייעודית מתאימה, עדיף לגשת אליו דרך ה־API הפתוח ב־OpenRouter.

ollama run hf.co/arcee-ai/Trinity-Mini-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל מופץ תחת רישיון שנקרא OpenMDW-1.1, ולא תחת רישיון פתוח מוכר וסטנדרטי כמו MIT או Apache. בכרטיס המודל לא מפורטים תנאי השימוש המלאים של הרישיון הזה, ולכן לפני הטמעה במוצר מסחרי חובה לבדוק את נוסח הרישיון המקורי בקישור שהשאירו המפתחים כדי לוודא שאין עליכם הגבלות שימוש או הפצה.

הרישיון המלא בעמוד המודל ↗