GPT
M

MiniCPM4-0.5B

קוד פתוח

openbmbapache-2.02025-06-05

  • transformers
  • safetensors
  • text-generation
  • conversational
  • custom_code

מודל שפה זעיר של 434 מיליון פרמטרים שרץ בקלות על מכשירי קצה וטלפונים. הוא תופס פחות מג'יגה בזיכרון וכולל חלון הקשר נדיב לגודל שלו.

  • 434Mפרמטרים
  • 32,768טוקנים בהקשר
  • 835 MBמשקל הקבצים
  • 44,884הורדות בחודש

מה זה

מדובר בגרסה הקטנה בסדרת MiniCPM4, שאומנה על טריליון טוקנים ומכוונת ישירות לחומרה חלשה ומכשירי קצה. הוא בנוי סביב ארכיטקטורה שכוללת מנגנון קשב דליל בשם InfLLM v2, שמחשב תלות של פחות מחמישה אחוזים מהטוקנים בטקסטים ארוכים כדי לקצץ בעומס החישובי.

בגזרה הזו של פחות מחצי מיליארד פרמטרים, רוב המודלים מציעים חלון הקשר קצרצר או מתקשים לעבד משפטים מורכבים. כאן שילבו אימון מקדים על 32 אלף טוקנים והרחבה לטווחים ארוכים יותר בשיטת YaRN. לפי היצרן, במבחני שליפת מידע מטקסט ארוך המודל מצליח לאתר נתונים בדיוק גבוה יחסית לגודלו, ומגיע לקצב פענוח מהיר משמעותית משל מתחרים על שבבים ייעודיים כמו Jetson Orin.

מתאים ל

  • חילוץ מידע מקומי

    ניתוח טקסטים ארוכים באנגלית על מכשיר קצה ללא שליחת מידע רגיש לענן.

  • סיווג טקסט מהיר

    מיון מיילים ופניות משתמשים בזמן תגובה אפסי וצריכת זיכרון מזערית.

  • סייען שיחה באופליין

    צ'אט בסיסי באנגלית או סינית למערכות משובצות ומכשירים מנותקי רשת.

איפה זה נופל

עם 434 מיליון פרמטרים בלבד, יכולת ההסקה והידע הכללי שלו מוגבלים מאוד בהשוואה למודלים של שמונה מיליארד ומעלה. הוא אומן על אנגלית וסינית בלבד, כך שעברית לא נתמכת רשמית ותניב פלט משובש או הזיות. בנוסף, הכרטיס מדגיש שהוא אינו מחזיק בשיקול דעת ודורש בדיקה אנושית של הפלט, כך שאסור להסתמך עליו במשימות קריטיות ללא ולידציה קשיחה.

אותה משפחה

MiniCPM4 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בעברית?

הוא אומן על אנגלית וסינית בלבד. אין לצפות לפלט תקין או שימושי בעברית, ואם צריך שפה מקומית מוטב לפנות למודלים אחרים או לבצע אימון המשך.

איזה כרטיס מסך צריך כדי להריץ אותו?

הוא תופס פחות מג'יגה בייט בזיכרון. כל כרטיס מסך ביתי בסיסי, מעבד של מחשב נייד או מודול כמו Jetson Orin יריצו אותו במהירות גבוהה מאוד.

איך מריצים

המשקל הכולל עומד על 835 מגה בייט בדיוק bfloat16, כך שכרטיס מסך פשוט או מעבד של מחשב נייד מריצים אותו בלי להרגיש. אין צורך בשרת מנופח, ואפשר להרים אותו ישירות בספריית transformers, או דרך vLLM וגרסה ייעודית של SGLang שמספקת ממשק תואם OpenAI.

אם אתם צריכים לנתח מאמרים באנגלית על לפטופ בלי חיבור לרשת, מריצים מקומית. לעומת זאת, אם המוצר שלכם דורש היגיון מורכב, כתיבת קוד רב שלבי או מענה בעברית, עדיף לשלם סנטים בודדים ל־API של מודל ענק ולא להילחם במגבלות הגודל.

from transformers import pipeline

pipe = pipeline("text-generation", model="openbmb/MiniCPM4-0.5B")
print(pipe("שלום"))

הרישיון

רישיון apache-2.0 מלא וחופשי. מותר להשתמש בו לצרכים מסחריים, לשנות את המשקלים, לשלב אותו בקוד סגור ולהפיץ אותו ללקוחות כחלק ממוצר, בלי לשלם תמלוגים. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים ונוסח הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗