GPT
M

MiniCPM5-1B-Agentic-Tooluse-GGUF

קוד פתוח

ewin-regother2026-07-07

  • gguf
  • llama.cpp
  • llama-cpp
  • minicpm
  • minicpm5

מודל קטן של מיליארד פרמטרים שעבר אימון ייעודי להפעלת כלים וקריאות פונקציה. הוא מתאים למי שחייב סוכן מקומי ומהיר במיוחד על חומרה חלשה.

  • 7.5 GBמשקל הקבצים
  • 2,108הורדות בחודש
  • 77לייקים

מה זה

המודל מבוסס על MiniCPM5-1B ועבר כוונון SFT ו־DPO באמצעות נתוני ToolACE כדי להתמודד עם קריאות לפונקציות. בניגוד לרוב המודלים בגודל מיליארד פרמטרים, שמתקשים לפלוט תחביר תקין של קוד, המודל הזה פולט מבנה XML ייעודי שמגדיר את שם הכלי והפרמטרים שלו.

בבדיקה חיצונית על 300 דוגמאות מתוך ToolACE, המודל הגיע ל־99.33% הצלחה ביצירת קריאות פונקציה שניתנות לפיענוח, ול־92.67% בבחירת הכלי הנכון מתוך רשימה נתונה. התוצאות האלה מראות שהוא יודע לבחור את הכלי המתאים כמעט תמיד, אבל הדיוק בפרמטרים המדויקים עומד על 65.33% בלבד, כך שעדיין תצטרכו שכבת אימות בקוד שלכם כדי לטפל בערכים שגויים.

מתאים ל

  • סוכן מקומי על מכשירי קצה

    הוא שוקל פחות מגיגה בקובץ המכווץ ורץ חלק על חומרה מקומית חלשה.

  • ניתוב פניות מבוסס כלים

    הוא מזהה את הכלי הנכון ב־92.67% מהמקרים ויודע להפעיל את הפונקציה המתאימה.

  • אוטומציה בתחביר XML

    פולט קריאות מובנות שקל לחתוך בצד השרת מיד עם סגירת התגית.

איפה זה נופל

הבעיה הגדולה ביותר היא שהמודל לא יודע מתי לעצור. רק ב־15% מהמקרים הוא מייצר סיום טבעי של הטקסט אחרי סגירת תגית הפונקציה, מה שמחייב את צד השרת לעצור את הריצה ידנית מיד כשמופיעה הסגירה. בנוסף, דיוק הארגומנטים עומד על 65.33% בלבד, כך שבשליש מהמקרים המודל מפספס ערכים או ממציא פרמטרים. לא הייתי משתמש בו למשימות קריטיות שמבצעות פעולות הרסניות ללא בדיקת סכמה קפדנית.

שאלות
נפוצות

האם המודל עוצר לבד כשהוא מסיים לקרוא לכלי?

לא. המודל מסיים באופן תקין רק ב־15% מהמקרים, ולכן חייבים להגדיר runtime שעוצר את הפליטה מיד לאחר תגית הסגירה של הפונקציה.

כדאי להפעיל את מצב החשיבה עבור קריאות לפונקציות?

לא, חובה לכבות אותו. כשהחשיבה דולקת המודל מבזבז טוקנים בתוך תגיות ייעודיות ולא מספיק להשלים את מבנה הקריאה.

האם גרסת ה־Q4_K_M נבדקה על מבחני הביצועים?

הבדיקה המדווחת של 300 המקרים נעשתה על מודל המקור ב־FP16 ולא על הקבצים המכווצים, ולכן הביצועים בפועל עשויים להיות נמוכים יותר.

איך מריצים

קובץ ה־Q4_K_M שוקל 688 מגה-בייט בלבד ורץ בקלות על מעבד רגיל, טלפון או מחשב פיתוח בסיסי באמצעות llama.cpp. אם אתם מחפשים דיוק גבוה יותר במחיר של משקל כפול, קובץ ה־Q8_0 שוקל 1.15 ג'יגה-בייט, וגרסת ה־F16 מגיעה ל־2.17 ג'יגה-בייט. ההרצה דורשת decoding דטרמיניסטי עם temperature 0, וחשוב לכבות את מנגנון החשיבה המובנה כדי שהמודל לא יבזבז טוקנים בתוך תגיות think.

אפשר להריץ אותו גם בשרת דרך vLLM או SGLang, אך התמיכה ב־GGUF ב־vLLM עדיין מוגדרת ניסיונית ודורשת תוסף חיצוני. אם אתם צריכים לטפל בארגומנטים מסובכים מאוד או בשיחות מורכבות בעברית, קריאה ל־API מסחרי גדול תיתן תוצאות אמינות בהרבה.

ollama run hf.co/ewin-reg/MiniCPM5-1B-Agentic-Tooluse-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון של המאגר מוגדר בתור other. ההגדרה הזו לא מפרטת תנאי שימוש ברורים, לכן אי אפשר לדעת אם מותר לשלב את הקבצים האלה במוצר מסחרי מבלי לבדוק את תנאי הרישיון המקוריים של OpenBMB על מודל הבסיס.

הרישיון המלא בעמוד המודל ↗