GPT
G

GLM-4.7-Flash-Claude-Opus-4.5-High-Reasoning-Distill-GGUF

קוד פתוח

TeichAIapache-2.02026-01-22

  • gguf
  • text-generation-inference
  • llama.cpp
  • unsloth
  • glm4_moe_lite

זיקוק חשיבה מבוסס קלוד אופוס שאומן על גבי מודל פלאש קל משקל. המטרה כאן היא להביא היגיון עמוק של מודל ענק לתוך סביבת ריצה פתוחה ומקומית.

  • 290 GBמשקל הקבצים
  • 3,942הורדות בחודש
  • 512לייקים

מה זה

הפרויקט הזה לוקח את המודל הבסיסי GLM-4.7-Flash ומאמן אותו על דאטה-סט קטן יחסית של תשובות מ־Claude 4.5 Opus ברמת חשיבה גבוהה. כל האימון דרש בסך הכול כ־2.13 מיליון תוקנים ועלות של 52.30 דולר. היוצרים מייעדים אותו בעיקר לקוד, מדע ומחקר מעמיק, מתוך ניסיון לחקות תהליכי פתרון של מודלים מובילים בלי לשלם עליהם לפי קריאה.

בפועל, תוצאות המבחנים מציגות תמונה מעורבת. מתוך שבעה מבחנים השוואתיים מול מודל הבסיס, המודל המזוקק ניצח בארבעה והפסיד בשלושה, עם שיפור ממוצע צנוע מאוד של אחוז בודד. היתרון הבולט ביותר נרשם ב־GPQA Diamond עם קפיצה מ־0.262 ל־0.292, וב־Winogrande שבו הציון עלה מ־0.468 ל־0.504. במבחנים אחרים, כמו MMLU ו־IFEval, ההבדלים זניחים לגמרי ולא בטוח שתרגישו בהם בפועל.

מתאים ל

  • פתרון בעיות מדעיות מורכבות

    מציג שיפור מדיד של כ־11.5% במבחן GPQA Diamond לעומת מודל הבסיס.

  • הסקה לוגית מובנית

    רושם ביצועים טובים יותר במבחן Winogrande בזכות זיקוק דוגמאות חשיבה מקלוד.

  • עבודה עם קריאות לכלים

    כולל תצורת דגימה ייעודית עם טמפרטורה נמוכה שמתאימה להפעלת פונקציות.

איפה זה נופל

האימון התבסס על סט נתונים מצומצם מאוד, ולכן השיפור מוגבל ונקודתי. במבחני הבנה וידע כמו ARC Challenge, HellaSwag ו־TruthfulQA המודל המזוקק אפילו קיבל ציונים נמוכים במעט ממודל הבסיס. אם המוצר שלכם נשען על ידע כללי נרחב או היגיון בריא, השינוי הזה לא בהכרח יועיל ויכול אף לגרוע.

אותה משפחה

GLM-4.7-Flash-Claude-Opus-4.5-High-Reasoning יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל שווה את משאבי החומרה ביחס למודל המקורי?

השיפור הממוצע עומד על אחוז בודד בלבד. אם המשימה שלכם אינה מדע מדויק או היגיון טהור, מודל הבסיס ייתן תוצאה כמעט זהה בפחות התעסקות.

איך כדאי להגדיר את הדגימה בזמן הרצה?

למשימות יומיומיות מומלץ להשתמש בטמפרטורה 1.0 וב־top_p של 0.95. למשימות שדורשות דיוק כמו קוד או קריאה לכלים, הורידו את הטמפרטורה ל־0.7, ואם התשובות לא יציבות אפשר לנסות לרדת עד 0.5.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־290 ג'יגה-בייט שמחולקים ל־19 קבצים בפורמט GGUF. כדי להריץ משקל כזה באופן מקומי דרושה תחנת עבודה חזקה במיוחד או שרת ייעודי עם נפח זיכרון עצום של VRAM ו־RAM. ההרצה נעשית דרך llama.cpp, vLLM או SGLang לפי ההנחיות של מודל הבסיס.

לשימוש כללי מומלץ להגדיר טמפרטורה של 1.0 ו־top_p של 0.95. אם אתם מתכננים להפעיל כלים או קריאות פונקציה, עדיף להוריד לטמפרטורה של 0.7. ב־llama.cpp חשוב לכוון ידנית min-p ל־0.01 במקום ערך ברירת המחדל.

ollama run hf.co/TeichAI/GLM-4.7-Flash-Claude-Opus-4.5-High-Reasoning-Distill-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא Apache 2.0. הרישיון מתיר שימוש מסחרי, שינוי של הקוד והפצה חופשית, כל עוד שומרים על הודעות זכויות היוצרים ומצרפים עותק של תנאי הרישיון המקוריים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗