GPT
M

MiniCPM5-1B-Claude-Opus-Fable5-V2-Thinking-GGUF

קוד פתוח

GnLOLotapache-2.02026-07-13

  • gguf
  • llama.cpp
  • quantized
  • minicpm5
  • thinking

זהו מודל קטן של מיליארד פרמטרים שמנסה לחקות חשיבה של קלוד אופוס עם דגש על הפעלת כלים. הוא מתאים למי שרוצה הרצה מקומית קלילה ומהירה במיוחד במחשב אישי.

  • 3.1 GBמשקל הקבצים
  • 370,692הורדות בחודש
  • 213לייקים

מה זה

הפרויקט הזה לוקח את בסיס המודל MiniCPM5 של מיליארד פרמטרים ועובר כוונון ייעודי על נתוני Fable 5. המטרה המרכזית בגרסה הזו היא חיזוק יכולות הפעלת פונקציות וכלים, לצד מצב חשיבה מובנה של שרשרת מחשבה. המודל שומר על תבנית השיחה המקורית של MiniCPM5 שמוטמעת ישירות בקובצי ה־GGUF, ותומך באנגלית ובסינית.

במדדי הביצועים רואים שיפור ברור בהפעלת כלים לעומת מודל הבסיס. במבחן API-Bank הוא קופץ מ־7.30 אחוזים ל־22.10 אחוזים, ובמבחן BFCL בבדיקה חיה הוא עולה מ־60.24 אחוזים ל־63.33 אחוזים. עם זאת, במבחני Tau-Bench המורכבים התוצאות נשארות נמוכות מאוד, כמו 8 הצלחות מתוך 115 בלבד בתחום הקמעונאות. זה מראה שהשיפור קיים, אך הוא עדיין מוגבל מאוד ביכולת לפתור משימות סבוכות.

מתאים ל

  • קריאות לפונקציות במכשיר קצה

    המודל עבר אופטימיזציה לשימוש בכלים ומספק קפיצה ל־22.10 אחוזים ב־API-Bank בגודל של 1.1 גיגה בייט בלבד.

  • סיוע בכתיבת קוד מקומית

    הוא מותאם למשימות קידוד ובדיקת שגיאות פשוטות ישירות בטרמינל או דרך llama.cpp בלי חיבור לרשת.

  • הסקה מהירה בלפטופ

    מתאים לשרתים מקומיים קטנים ב־LM Studio כשצריך שרשרת חשיבה בלי להעמיס על משאבי המערכת.

איפה זה נופל

הגודל שלו הוא המגבלה המרכזית. עם מיליארד פרמטרים בלבד, הוא רחוק מרמת הביצועים של מודלי חזית ולא יחליף מודלים כבדים בהיגיון עמוק. במצב חשיבה הוא פולט בלוקים שלמים של תהליך מחשבה לפני התשובה הסופית, מה שמחייב התאמה של צד הלקוח אם רוצים לקבל פלט נקי. בנוסף, הוא מאומן רק על אנגלית וסינית ולכן אינו מתאים לשימוש בעברית. התוצאות הנמוכות במבחני Tau-Bench מחייבות בדיקה קפדנית לפני שסומכים עליו בתהליכים אוטומטיים.

אותה משפחה

MiniCPM5-1B-Claude-Opus-Fable5 יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל מתאים לשימוש שוטף בעברית?

לא. המודל מאומן ותומך רשמית רק באנגלית ובסינית. אין להסתמך עליו בעיבוד טקסט בעברית או במשימות מקומיות בישראל.

באיזה קובץ כדאי לבחור מתוך המאגר?

גרסת Q8_0 היא המומלצת על ידי המפתח. היא שוקלת כ־1.1 גיגה בייט בלבד, רצה מהר מאוד ושומרת על רמת דיוק קרובה למקור.

איך מבטלים את פלט החשיבה הארוך בתשובה?

כרטיס המודל מציע להגדיר את הפרמטר enable_thinking לערך False, ולהוריד את הטמפרטורה ל־0.7 כדי לקבל מענה ישיר וקצר.

איך מריצים

ההרצה פשוטה מאוד באמצעות llama.cpp, Ollama או LM Studio. יש כאן שתי גרסאות עיקריות: קובץ Q8_0 ששוקל כ־1.1 גיגה בייט ומוגדר כברירת המחדל המומלצת, וקובץ F16 ששוקל כ־2.1 גיגה בייט ומיועד לדיוק מלא. בגלל המשקל הזעום, אפשר להריץ אותו כמעט על כל מעבד מודרני או כרטיס מסך בסיסי בלי שום מאמץ.

הקונפיגורציה תומכת בחלון הקשר של עד 128 אלף טוקנים, אבל צריכת הזיכרון תעלה משמעותית אם תפתחו חלון כזה בפועל. אם המטרה היא משימות ניתוח עמוקות או הבנת שפה מורכבת במיוחד, עדיף להשתמש ב־API של מודלים גדולים באמת במקום להסתמך על מודל בגודל מיליארד פרמטרים.

ollama run hf.co/GnLOLot/MiniCPM5-1B-Claude-Opus-Fable5-V2-Thinking-GGUF:Q8_0

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל מופץ תחת רישיון apache-2.0. הרישיון מאפשר שימוש מסחרי, שינוי של הקוד והפצה חופשית של המוצר שלכם. התנאי המרכזי הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי בקבצים שתפיצו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗