GPT
M

MiniCPM5-1B-Claude-Opus-Fable5-Thinking-GGUF

קוד פתוח

GnLOLotapache-2.02026-07-03

  • gguf
  • llama.cpp
  • quantized
  • minicpm5
  • thinking

מודל מכווץ של מיליארד פרמטרים שרץ מקומית על כמעט כל מחשב ומביא יכולת חשיבה בשלבים. הוא נותן חלון הקשר עצום של 128 אלף טוקנים בלי צורך בשרת יקר.

  • 4.5 GBמשקל הקבצים
  • 349,778הורדות בחודש
  • 329לייקים

מה זה

מדובר בהסבה של MiniCPM5 שעבר אימון נוסף על נתוני Fable 5 ונארז בפורמט GGUF. החידוש המרכזי בגודל כזה הוא שילוב של מנגנון חשיבה מובנה, שמייצר שלבי ניתוח לפני התשובה הסופית, יחד עם תמיכה מוצהרת ברצף של עד 131,072 טוקנים.

הוא מיועד לכתיבת קוד, פתרון באגים ומעקב מדויק אחרי הוראות, בלי לצאת מהמחשב האישי שלכם. השפות הנתמכות לפי התיעוד הן אנגלית וסינית, כך שמי שמחפש עברית ייתקל בקושי.

היוצרים כבר הוציאו גרסת V2 שמשפרת קריאה לכלים חיצוניים, כך שאם tool calling הוא הדבר העיקרי שאתם צריכים, הגרסה הזו כבר מעט מיושנת.

מתאים ל

  • עוזר קוד מקומי

    מייצר ומתקן פונקציות ישירות על המחשב בלי לשלוח שורות קוד לרשת ובלי צורך בחיבור אינטרנט.

  • ניתוח מסמכים טכניים

    חלון של 128 אלף טוקנים מאפשר להזין קבצי קוד ארוכים או לוגים באנגלית ולחלץ מהם שגיאות.

  • הסקה בשלבים במכשיר קצה

    התבנית המובנית מפעילה שרשרת חשיבה שמפרקת בעיות לוגיות מורכבות בגודל קובץ של 1.1 ג'יגה בלבד.

איפה זה נופל

המודל מחזיק רק מיליארד פרמטרים, ולכן אין לו את הידע הכללי או העומק של מודלים ענקיים. הוא פולט בלוקים שלמים של חשיבה לפני התשובה, מה שעלול לשבור תהליכי אוטומציה שלא נבנו לזהות ולסנן את התהליך הפנימי. בנוסף, אין בו תמיכה מוצהרת בעברית, והניסיון לדחוף 128 אלף טוקנים על חומרה חלשה פשוט יחנוק את המערכת.

אותה משפחה

MiniCPM5-1B-Claude-Opus-Fable5 יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ אותו במחשב ישן בלי כרטיס מסך ייעודי?

כן. קובץ ה־Q8_0 שוקל 1.1 ג'יגה בלבד ורץ בקלות על מעבד מרכזי רגיל וזיכרון RAM סטנדרטי. המגבלה היחידה תופיע אם תנסו לפתוח הקשר ענק של עשרות אלפי טוקנים, שדורש הרבה זיכרון עבודה.

האם הוא מתאים לשימוש בעברית?

לא מומלץ לבנות עליו לפרויקטים בעברית. המודל אומן והוגדר רשמית עבור אנגלית וסינית בלבד, ובגודל של מיליארד פרמטרים יכולת ההכללה לשפות שלא נתמכו נמוכה מאוד.

איך מריצים

טוענים את קובץ ה־GGUF ישירות לתוך llama.cpp, Ollama או LM Studio. הגרסה המומלצת ביותר היא Q8_0 ששוקלת 1.1 ג'יגה־בייט בלבד, אבל מי שלחוץ במקום יכול לרדת ל־Q4_K_M שלוקח 657 מגה־בייט. בשביל משקל כזה לא צריך מעבד גרפי חזק, מעבד מחשב רגיל מריץ אותו במהירות.

החלק שעלול להפתיע הוא הזיכרון שנדרש להקשר. אם תרצו לנצל את מלוא 128 אלף הטוקנים, תצטרכו להקצות המון זיכרון עבודה עבור ה־KV cache, ושם מחשב משרדי רגיל יתחיל לזחול. במצבים של מסמכים מסיביים, לפעמים עדיף לקרוא למודל ענן.

ollama run hf.co/GnLOLot/MiniCPM5-1B-Claude-Opus-Fable5-Thinking-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא Apache 2.0 מלא. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו בתוך מוצר סגור, בלי לשלם תמלוגים. הדרישה העיקרית היא לשמור על ייחוס ליוצרים ולהשאיר את עותק הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗