GPT
M

MiniCPM5-1B-Claude-Opus-Fable5-V2-Thinking

קוד פתוח

GnLOLotapache-2.02026-07-13

  • transformers
  • safetensors
  • llama
  • text-generation
  • minicpm

זהו שילוב בין גודל זעיר של מיליארד פרמטרים ליכולות חשיבה והפעלת כלים. מתאים למי שרוצה להריץ סוכן מקומי על חומרה פשוטה בלי לגעת בענן.

  • 1.1Bפרמטרים
  • 131,072טוקנים בהקשר
  • 2.0 GBמשקל הקבצים
  • 1,373הורדות בחודש

מה זה

מדובר בכיוונון של מודל הבסיס MiniCPM5-1B על גבי נתוני Fable 5, שנועד לשפר מעקב אחר הוראות, כתיבת קוד והפעלת פונקציות בפורמט XML. הוא מביא איתו תבנית צ'אט שתומכת בחשיבה פנימית לפני הפלט, לצד תמיכה בחלון הקשר של 131,072 טוקנים, נתון חריג מאוד ביחס לגודל הפיזי שלו.

המספרים מהמבחנים מראים שיפור קונקרטי בהפעלת כלים ביחס למודל הבסיס. במבחן API-Bank הציון קפץ מ־7.30% ל־22.10%, ובמבחני BFCL נרשמה עלייה קלה ל־63.33% בגרסת הלייב. במבחן Tau-Bench ההבדלים קטנים בהרבה, 18 הצלחות מתוך 50 בתחום הטיסות ו־8 מתוך 115 בקמעונאות. זה אומר שהוא מבין קריאות לכלים טוב יותר מהבסיס, אבל הוא עדיין מוגבל כשמדובר ברצף מורכב של פעולות.

מתאים ל

  • הפעלת פונקציות מקומית

    חילוץ קריאות לפונקציות בפורמט XML מתוך טקסט פשוט, על גבי מחשב מקומי וללא תלות ברשת.

  • כתיבת קוד בסיסית במכשיר קצה

    יצירה ותיקון של פונקציות פשוטות בשפות נפוצות ישירות במחשבים ללא חומרה ייעודית.

  • סוכנים קלים לחומרה חלשה

    מערכות אוטומציה שדורשות שרשרת חשיבה קצרה ומעקב אחר פקודות בלי לתפוס זיכרון עבודה רב.

איפה זה נופל

גודל של מיליארד פרמטרים מציב רף עליון ברור. המודל פשוט קטן מדי למשימות היגיון מורכבות, ושיעורי ההצלחה הנמוכים ב־Tau-Bench מדגימים שהוא מתקשה מאוד בסביבות מרובות שלבים. בנוסף, הוא פולט בלוקים של חשיבה לפני התשובה הסופית, מה שמחייב אתכם לנקות את הטקסט בעצמכם אם אתם מציגים אותו למשתמש קצה. נקודה קריטית למשתמש הישראלי: המודל אומן ותומך רשמית רק באנגלית ובסינית, כך שאין כאן התאמה לעברית.

אותה משפחה

MiniCPM5-1B-Claude-Opus-Fable5 יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל עובד בעברית?

התיעוד מגדיר תמיכה באנגלית ובסינית בלבד. הוא עשוי לפלוט מילים בעברית אם יידרש לכך, אבל חוסר האימון בשפה יוביל לשגיאות תכופות, אי דיוקים תחביריים ותרגום עילג.

מה צריך לעשות עם שלב החשיבה בפלט?

המודל מתוכנת לחשוב בקול לפני שהוא מייצר את התשובה הסופית. אם אתם בונים ממשק משתמש, תצטרכו להגדיר סינון בצד שלכם שיסיר את קטעי ה־Thinking, או לכבות את המצב בעזרת הפרמטר enable_thinking בזמן היצירה.

האם חלון של 128K טוקנים באמת שימושי במודל כזה?

מבחינה טכנית הארכיטקטורה מקבלת את הקלט, אבל מודל של מיליארד פרמטרים מתקשה לזכור ולשלוף מידע מדויק מתוך עשרות אלפי טוקנים. עדיף לא להסתמך עליו לניתוח מסמכי ענק שלמים אלא למשימות ממוקדות יותר.

איך מריצים

בגודל של שני ג'יגה בייט ומיליארד פרמטרים, כל כרטיס מסך ביתי או מחשב נייד פשוט עם מעבד סביר יכולים להריץ אותו בלי מאמץ דרך transformers או בעזרת גרסאות GGUF קיימות דרך Ollama ו־llama.cpp. בקוד צריך רק להשתמש ב־trust_remote_code ו־bfloat16.

אם אתם צריכים רק עזרה פשוטה או אוטומציה של פונקציה יחידה, אין שום סיבה לשלם על API חיצוני. מצד שני, אם המערכת שלכם נשענת על הבנת הקשרים עמוקה בריבוי שלבים או דורשת אמינות מוחלטת בניתוח מסמכים שלמים, עדיף לפנות למודל גדול יותר בענן.

from transformers import pipeline

pipe = pipeline("text-generation", model="GnLOLot/MiniCPM5-1B-Claude-Opus-Fable5-V2-Thinking")
print(pipe("שלום"))

הרישיון

רישיון apache-2.0 מתיר שימוש חופשי לחלוטין, כולל שימוש מסחרי, שינוי הקוד והפצה פנימית או חיצונית בתוך מוצר. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי בקבצים שתפיצו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗