GPT
M

MiniCPM-2B-sft-bf16

קוד פתוח

openbmbרישיון לא דווח2024-01-29

  • transformers
  • pytorch
  • text-generation
  • MiniCPM
  • ModelBest

שוקל בקושי 5.1 גיגה בייט ומיועד למכשירים חלשים, עם ביצועים שמתחרים בכלים כבדים בהרבה. מתאים למי שרוצה להריץ מודל מקומית על לפטופ בלי לשלם על שרתים יקרים.

  • 4,096טוקנים בהקשר
  • 5.1 GBמשקל הקבצים
  • 23,490הורדות בחודש
  • 127לייקים

מה זה

מדובר במודל שפה קטן של 2.4 מיליארד פרמטרים שאינם שכבות הטמעה, שעבר אימון הוראות עדין. המפתחים שלו טוענים שבמבחנים כלליים הוא מציג תוצאות קרובות למודלים של שבעה מיליארד פרמטרים כמו Mistral, ומציג דיוק עדיף במתמטיקה, בקוד ובסינית לעומת מודלים גדולים משמעותית כמו Llama2 בגרסת 13B ואפילו Falcon 40B.

המשמעות בפועל היא יכולת דחיסה מרשימה של ידע חישובי לתוך מעט מאוד מקום, בלי לזלול זיכרון. עם זאת, הוא אומן בעיקר על אנגלית וסינית, כך שאי אפשר לצפות ממנו לעבודה חלקה או אמינה בעברית.

מתאים ל

  • עוזר מקומי למכשירי קצה

    רץ ישירות על לפטופים ומכשירים ניידים בלי שרת מרוחק ובמהירות גבוהה מקצב דיבור.

  • עיבוד משימות קוד באנגלית

    הכרטיס מדווח על ביצועים גבוהים בלוגיקה ובקוד יחסית לגודל של שני מיליארד פרמטרים.

  • יישומי RAG חסכוניים

    הזיכרון שלו חלש, אבל הוא מתאים לשליפת תשובות מטקסט שמזרימים לו ישירות בחלון ההקשר.

איפה זה נופל

בגלל הנפח המצומצם, המודל סובל מזיכרון עובדתי לקוי ונוטה להזיות, תופעה שמחמירה כשהתשובות ארוכות. הוא רגיש מאוד לניסוח הפרומפט, כך שאותו ניסוח יכול להניב תוצאות לא עקביות בניסיונות שונים. בנוסף, המפתחים לא אימנו אותו על זהות עצמית והשתמשו במידע מ־ShareGPT, לכן הוא עלול להציג את עצמו בטעות כאילו הוא מודל של OpenAI.

אותה משפחה

MiniCPM יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר לשלב אותו במוצר מסחרי מיד לאחר ההורדה?

לא באופן אוטומטי. הקוד חופשי תחת Apache 2.0, אך המשקלים דורשים אישור בכתב מהיוצרים בדוא"ל לפני שילוב מסחרי.

באיזו ספרייה כדאי להריץ אותו כדי לקבל תוצאות מקסימליות?

המפתחים מדווחים שאיכות הפלט בספריית transformers נמוכה יותר, וממליצים להשתמש ב־vLLM לצורך בדיקות והרצה.

איך מריצים

את המשקלים האלה מריצים בקלות על כרטיס מסך בודד כמו GTX 1080 או RTX 2080 לצורך אימון חלקי, ואפשר לבצע כוונון מלא על כרטיס ביתי כמו RTX 3090 או 4090. בזמן הטעינה בספריית transformers חובה לציין במפורש bfloat16 כדי להימנע מטעויות חישוב ודליפות זיכרון. המפתחים מזהירים שהרצה דרך huggingface מניבה תוצאות פחות טובות בהשוואה לשימוש ב־vLLM, כך שמומלץ לבדוק אותו שם.

אם אתם לא צריכים ריצה מקומית על חומרה זולה או על מכשיר קצה, אין סיבה להסתבך עם פריסה עצמית, עדיף פשוט לצרוך API של מודל ענן גדול ומדויק יותר.

from transformers import pipeline

pipe = pipeline("text-generation", model="openbmb/MiniCPM-2B-sft-bf16")
print(pipe("שלום"))

הרישיון

הקוד פתוח לפי רישיון Apache 2.0, אבל המשקלים עצמם כפופים לרישיון General Model License. מחקר אקדמי חופשי לחלוטין, אך שימוש מסחרי מותנה בפנייה למפתחים במייל וקבלת אישור בכתב, אם כי ההרשאה עצמה ניתנת ללא תשלום.

הרישיון המלא בעמוד המודל ↗