GPT
M

MiniCPM-MoE-8x2B

קוד פתוח

openbmbרישיון לא דווח2024-04-07

  • transformers
  • pytorch
  • text-generation
  • conversational
  • custom_code

ארכיטקטורת מומחים שדורשת חישוב של מודל קטן עם קיבולת של מודל רחב בהרבה. הוא מפעיל רק שני מומחים מתוך שמונה בכל צעד, ומגיע מוכן לשיחה.

  • 4,096טוקנים בהקשר
  • 25.8 GBמשקל הקבצים
  • 4,311הורדות בחודש
  • 46לייקים

מה זה

מדובר במודל שפה שמבוסס על שמונה מומחים של שני מיליארד פרמטרים בכל שכבה, כאשר עבור כל טוקן הוא מפעיל שניים בלבד. המבנה הזה נותן מהירות ריצה גבוהה בהרבה ביחס לגודל הכולל של המשקלים בזיכרון, כי כוח העיבוד הנדרש בכל רגע נתון נשאר נמוך.

הוא עבר כוונון להוראות מראש, מה שאומר שלא צריך לאמן אותו מאפס כדי לנהל שיחה או לענות על שאלות. התבנית לשיחה מובנית בו ישירות. המפתחים לא צירפו מבחני ביצועים מספריים בכרטיס, אבל הדוגמה שהם בחרו להציג היא שאלת ידע והשוואה גאוגרפית בסינית, שמראה את הכיוון הטבעי שלו.

מתאים ל

  • בוט שיחה מהיר ומקומי

    הפעלת שני מומחים בלבד מאפשרת מענה קצר ומהיר בלי להעמיס על המעבד הגרפי.

  • מענה על שאלות ידע

    הוא מגיע מכוונן להוראות ומסוגל לעבד שאלות השוואה מורכבות ישירות מהקופסה.

  • מחקר על מודלי מומחים

    בסיס טוב לבדיקת ניתוב טוקנים וארכיטקטורת מומחים על גודל בינוני.

איפה זה נופל

היוצרים מציינים בפירוש שהמודל עבר כוונון להוראות בלבד, ללא שלב של למידה מחיזוקים לפי משוב אנושי. בלי השלב הזה, מודלים נוטים להמציא עובדות בביטחון רב, לפספס סרקאזם או לייצר פלטים לא צפויים כשדוחקים אותם לפינה. בנוסף, חלון ההקשר עומד על ארבעת אלפים טוקנים בלבד, שזה מעט מאוד למסמכים ארוכים. המפתחים גם מבהירים שהמודל אינו מבין דעות או שיפוט ערכי, וכל בדיקת תוכן חלה עליכם בלבד.

שאלות
נפוצות

האם המודל דורש כוח עיבוד של מודל ענק?

לא בזמן החישוב עצמו. המודל מפעיל רק שני מומחים מתוך שמונה עבור כל מילה, ולכן פעולת החישוב קלה יחסית. מצד שני, כל המשקלים שלו חייבים לשבת בזיכרון כרטיס המסך, כך שנפח הזיכרון הנדרש עדיין גבוה.

האם אפשר להשתמש בו במוצר מסחרי כרגע?

לא מומלץ בכלל. המפתח לא ציין רישיון שימוש בקבצים, ולכן מבחינה חוקית אין לכם הרשאה להשתמש בו ליישום עסקי או להפיץ אותו. צריך לפנות למאגר הקוד שלהם ולבדוק אם יש שם הבהרה.

איך מריצים

המשקלים שוקלים כמעט עשרים ושישה גיגה בייט בפורמט המקורי, כך שתצטרכו כרטיס מסך עם לפחות שלושים ושניים גיגה זיכרון כדי לטעון אותו, או להשתמש בכימות. הטעינה נעשית ישירות דרך ספריית הטרנספורמרס, ומחייבת הפעלה של קוד מרוחק בגלל הארכיטקטורה הייחודית.

אם אתם צריכים קצב עיבוד מהיר באמת, עדיף להריץ אותו דרך מנוע חיצוני שתומך בו מגרסה אפס נקודה ארבע ומעלה. אם אין לכם חומרה מקומית מתאימה עם מספיק זיכרון וידאו, החזקת שרת ייעודי רק בשבילו תעלה לא מעט ביחס למודל קטן, ועדיף לשקול חלופות ענן.

from transformers import pipeline

pipe = pipeline("text-generation", model="openbmb/MiniCPM-MoE-8x2B")
print(pipe("שלום"))

הרישיון

הרישיון לא דווח בעמוד המודל. במצב כזה אין אישור מפורש לשימוש מסחרי, ואי אפשר לדעת מה המגבלות המשפטיות על הפצה או שילוב שלו במוצר סגור. עד שהמפתחים לא יפרסמו רישיון ברור בקוד המקור, שימוש מסחרי בו חושף אתכם לסיכון משפטי.

הרישיון המלא בעמוד המודל ↗