GPT
T

Tiel-Coder-35B-A3B-GGUF-MTP

קוד פתוח

peculiar-ragdollmit2026-08-24

  • gguf
  • llama.cpp
  • qwen35moe
  • moe
  • imatrix

גרסת GGUF מכוילת של מודל קוד מבוסס MoE, הכוללת ראש חיזוי רב-טוקנים שמאיץ יצירה מקומית. הוא מיועד למי שמחפש תיקון באגים מהיר ושיחות מרובות שלבים בלי לשלם על מודל סגור.

  • 195 GBמשקל הקבצים
  • 263,911הורדות בחודש
  • 134לייקים

מה זה

מדובר בגרסה מכוילת דינמית של Ornith-1.5-35B-A3B שרצה עם תבנית שיחה בשם Sharp וראש MTP מאומן. המודל בנוי כארכיטקטורת MoE עם 256 מומחים שמפעילה 8 מומחים לכל טוקן, ובנוסף תומך בקלט תמונה לצד טקסט באמצעות מקרן ייעודי. הכיול נעשה על קורפוס שרובו קוד, במטרה לתת מענה ממוקד למשימות תכנות מעשיות.

במבחני SWE-bench-Live הוא פתר 12 מתוך 25 בעיות, תוצאה שמשתווה למודלים מסחריים גדולים ועוקפת את מודל הבסיס שלו שפתר 8 בלבד, בחציון של 8.6 דקות לניסיון. במבחן השיחה הרב-שלבית Claw-Eval הוא השיג ציון של 67.2 לעומת 65.3 של מודל הבסיס, בעיקר בזכות תשובות קצרות ומדויקות יותר. המחיר של התבנית הזו ניכר בידע כללי, שם הוא קיבל 73.7 במבחן MMLU-Pro.

מתאים ל

  • סוכן תיקון באגים בקוד

    פותר בעיות קוד אמיתיות מהר עם חלון הקשר ארוך ומדדי SWE-bench-Live שמקבילים למודלים ענקיים.

  • עבודה שוטפת בסביבת פיתוח

    מייצר קוד בקצב גבוה בזכות האצת ראש החיזוי, ומתאים לשיחות ארוכות של דיבוג בלי לאבד את ההקשר.

  • ניתוח תרשימי מערכת

    מאפשר לשלוח תמונות של ארכיטקטורה או צילומי מסך לצד הקוד באמצעות קובץ המקרן הייעודי שמצורף אליו.

איפה זה נופל

המודל חלש במבחני ידע כללי ובשאלות טריוויה מורכבות, ופער של מעל 10 נקודות ב־MMLU-Pro לעומת חלופות באותו גודל מעיד על כך בבירור. הוא מתוכנת לקצר, ולכן הוא מאבד 5.1 נקודות בשאלות הבהרה בהשוואה למודל המקורי. אם תתנו לו הנחיה מעורפלת, הוא ינחש ויענה במקום לשאול שאלות מקדימות. בנוסף, הוא אומן רק באנגלית ובסינית, כך שאין לצפות לביצועים סבירים בעברית.

שאלות
נפוצות

האם אפשר להריץ אותו אם יש לי רק 16 גיגה-בייט זיכרון כולל?

כן, גרסת IQ3_XXS שוקלת 14.1 גיגה-בייט ומיועדת בדיוק לסף הזה. גרסת ה־2-bit קטנה מעט יותר אך מאבדת יכולות תכנות קריטיות, ולכן עדיף להישאר ב־3-bit ולא לרדת מתחתיה.

למה ראש ה־MTP לא מאיץ לי את הריצה?

אם לא הפעלתם את הדגל spec-type draft-mtp, השרת מתעלם מהתקרה הזו לחלוטין וסתם מעמיס 0.9 גיגה-בייט לזיכרון. אם הפעלתם והמהירות ירדה, ייתכן שערך טוקני הטיוטה גבוה מדי לחומרה שלכם וכדאי להגביל אותו לניחוש של טוקן יחיד.

האם המודל מתאים לתשאול משתמשים לצורך אפיון דרישות?

לא. התבנית שלו נבנתה לספק תשובות קצרות וישירות על חשבון שאלות הבהרה, ולכן הוא נוטה לרוץ לפתרון במקום לברר מה חסר בבקשה מעורפלת.

איך מריצים

ההרצה נעשית דרך llama-server עם דגל spec-type draft-mtp שמפעיל את ראש החיזוי. בלי הדגל הזה הראש תופס 0.9 גיגה-בייט של זיכרון סרק. הגרסה המומלצת להתחלה היא UD-Q4_K_XL שתופסת 23.3 גיגה-בייט ודורשת 24 עד 32 גיגה-בייט של שילוב RAM ו־VRAM. גרסת IQ3_XXS במשקל 14.1 גיגה-בייט נכנסת ב־16 גיגה-בייט משותפים, וגרסאות כמו Q6 ו־Q8 דורשות 48 גיגה-בייט.

ארכיטקטורת ה־MoE שומרת על גודל KV קטן של פחות מ־5 גיגה-בייט בהקשר של 262 אלף טוקנים. בבדיקות של המפרסמים, חיזוי של טוקן בודד קדימה העלה את הקצב מ־77.4 ל־94.4 טוקנים לשנייה, אך חיזוי של 8 טוקנים הפיל את הקצב ל־46.5. מומלץ לבצע בדיקת ביצועים קצרה על החומרה שלכם כדי לכוון את הפרמטרים במקום להסתמך על שיעור קבלת הניחושים.

ollama run hf.co/peculiar-ragdoll/Tiel-Coder-35B-A3B-GGUF-MTP:Q4_K_S

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל מופץ תחת רישיון MIT, בדיוק כמו מודל הבסיס שלו. הרישיון מאפשר שימוש חופשי לחלוטין, כולל שימוש מסחרי, שינוי המשקלים, הפצה פנימית או שילוב במוצר תוכנה חיצוני. התנאי היחיד הוא שמירת הודעת זכויות היוצרים ונוסח הרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗