GPT
G

gemma-4-12B-agentic-fable5-composer2.5-v2-3.5x-tau2-GGUF

קוד פתוח

yuxinlu1apache-2.02026-06-19

  • gguf
  • gemma4
  • coding
  • agentic
  • terminal

התאמה אישית של גמא 12B שמתמקדת נטו בכתיבת קוד ושימוש בכלים בטרמינל. היא פותרת את הנטייה של מודלים קטנים לוותר באמצע תהליכי ניפוי שגיאות מורכבים.

  • 35.5 GBמשקל הקבצים
  • 632,420הורדות בחודש
  • 1,541לייקים

מה זה

היוצר לקח את מודל הבסיס של גוגל ואימן אותו מחדש על דאטה של שרשראות חשיבה סינתטיות שנוצרו באופוס, במטרה ללמד אותו להתנהג כמו סוכן עצמאי. במקום לענות ולעצור, הוא בנוי לקרוא קבצים, להריץ פקודות, לבדוק את התוצאה ורק אז לתקן. במבחן טאו 2 טלקום, שמדמה פתרון תקלות בטרמינל דרך לולאה של אבחון ותיקון, המודל הגיע לתוצאה של בערך 55 אחוזים לעומת כ־15 אחוזים בלבד של מודל הבסיס.

הקפיצה הזו נובעת בעיקר מזה שהוא מפסיק להרים ידיים. בזמן שמודל הבסיס מעביר משימות לנציג אנושי ברגע שמשהו מסתבך, הגרסה הזו ממשיכה לנסות בלולאה. המחיר של המיקוד הזה מורגש בידע כללי, שם הביצועים שלו נמוכים יותר ממודל הבסיס במבחן MMLU-Pro. הוא לא נבנה כדי לענות על שאלות טריוויה או לשמש כבוט שירות לקוחות, אלא ככלי עבודה טכני.

מתאים ל

  • סוכן מקומי לטרמינל

    הוא יודע להריץ פקודות בדיקה, לקרוא לוגים ולאמת תוצאות בלי להמציא נתיבים שלא קיימים במערכת.

  • ניפוי שגיאות פייתון

    האימון כלל שרשראות חשיבה שאומתו מול טסטים אמיתיים, כך שהוא עובד בלולאת תיקון עד שהקוד רץ.

  • עבודה על קוד רגיש

    הוא רץ כולו מקומית על מחשב אישי בזיכרון של כ־7 ג'יגה בייט, בלי להוציא מידע לרשת.

איפה זה נופל

המודל עדיין רחוק ממודלי קצה סגורים שמגיעים ליותר מ־90 אחוזים באותם מבחנים. כשהוא נתקל בבעיה קשה הוא נוטה לפעמים להיתקע בלולאות של ניסיונות סרק חוזרים במקום להבין שצריך גישה אחרת. בנוסף, האימון התמקד במשימות ולא עבר התאמות בטיחות, מה שאומר שהוא מסרב להרבה פחות בקשות ודורש מעטפת הגנה אם חושפים אותו למשתמשי קצה. ההתאמה שלו לעברית מוגבלת מאוד כי הדאטה ממוקד כמעט כולו באנגלית, והגדרות דגימה שגויות יגרמו לו לפלוט רצפים מקולקלים של אפסים.

אותה משפחה

gemma-4-12B-agentic-fable5-composer2.5-v2-3.5x-tau2 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

למה הפלט שלי מציג תגיות tool call שבורות או רצף של אפסים?

זה קורה כמעט תמיד בגלל הגדרות דגימה בתוכנת ההרצה. חובה להפעיל repetition penalty על ערך של 1.1 כדי למנוע הישנות תווים, ולהשתמש בדגל jinja ב־llama.cpp כדי שהמערכת תפענח נכון את מבנה הכלים הפנימי של גמא.

האם שווה לשדרג מגרסת הבסיס הרשמית של גוגל?

רק אם השימוש המרכזי הוא כתיבת קוד, אוטומציה וקריאה לכלים. המודל הזה מפגין עקשנות גבוהה בהרבה בפתרון תקלות, אבל אם אתם צריכים מענה כללי או ידע רחב, מודל הבסיס עדיין עדיף.

איך מפעילים פענוח ספקולטיבי באמצעות MTP?

ההרצה עובדת כרגע בצורה תקינה רק בבילד b9553 של llama.cpp באמצעות טעינת קובץ הדראפט המצורף. בילדים חדשים יותר סובלים מבאג פנימי שגורם להתרסקות בטעינת המודל המסייע.

איך מריצים

בשביל להריץ אותו מקומית צריך גרסה עדכנית של llama.cpp שתומכת בארכיטקטורה החדשה, ולהפעיל את הדגל jinja כדי שהקריאות לכלים יעבדו כמו שצריך. הגרסאות מתחילות מ־Q3_K_M במשקל 5.7 ג'יגה בייט שמתאימה לכרטיסים עם 8 ג'יגה זיכרון, ומגיעות עד Q8_0 ששוקלת 11.8 ג'יגה בייט ומספקת איכות כמעט מלאה. נקודת האמצע המומלצת היא Q4_K_M שדורשת בערך 6.87 ג'יגה בייט זיכרון ורצה היטב גם עם 4.5 ג'יגה פנויים אם מקצצים קצת בהקשר.

אם יש לכם כרטיס גרפי צנוע ואתם צריכים סוכן מקומי שיעבוד אופליין בלי לחשוף קוד רגיש, שווה להריץ אותו. אם המטרה היא לקבל דיוק מקסימלי במשימות ענק בלי להסתבך עם הגדרות סמפלר ומשתני הרצה, עדיף להישאר עם API של מודל ענן גדול, שעדיין מוביל עליו בפער ניכר.

ollama run hf.co/yuxinlu1/gemma-4-12B-agentic-fable5-composer2.5-v2-3.5x-tau2-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל מופץ תחת רישיון אפאצ'י 2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי חופשי, שינוי של המשקולות והפצה מחדש בתוך מוצרים, ללא תשלום תמלוגים. התנאי העיקרי הוא שמירה על הודעת זכויות היוצרים וכתב הוויתור על אחריות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗