GPT
I

internlm2-chat-20b

קוד פתוח

internlmother2024-01-10

  • transformers
  • safetensors
  • internlm2
  • text-generation
  • conversational

מודל שיחה בגודל ביניים שמתמקד בחשיבה מתמטית וקוד, עם יכולת מוכחת לעקוף את GPT-3.5 בכמה מבחנים. הוא מיועד למי שצריך תמיכה בהקשרים ארוכים והפעלת כלים בלי לשלם על מודלי ענק.

  • 20Bפרמטרים
  • 32,768טוקנים בהקשר
  • 37.0 GBמשקל הקבצים
  • 19,483הורדות בחודש

מה זה

הפיתוח הזה מציע שילוב של 20 מיליארד פרמטרים שיושב בדיוק בין מודלי ה־7B הקלים למודלי ה־70B הכבדים. הוא מותאם במיוחד לשיחה, לפתרון בעיות חישוביות ולהפעלת כלים חיצוניים דרך מעטפת של סוכנים.

במבחני ביצועים רשמיים של OpenCompass הוא מציג תוצאות מעניינות. בבדיקות מתמטיות כמו GSM8K הוא הגיע לציון 79.6 וב־MATH קיבל 31.9, נתונים שעוקפים את GPT-3.5 באותם מבחנים. גם ב־HumanEval לכתיבת קוד הוא השיג 67.1, שזה שיפור חד לעומת גרסת ה־7B שלו, אף שעדיין נשאר מעט מאחורי המודלים של OpenAI במדדי ידע כללי כמו MMLU.

מתאים ל

  • ניתוח נתונים והרצת קוד

    הוא מגיע עם יכולת מובנית לפעול כמתורגמן קוד ולהגיע לדיוק גבוה בחישובים מורכבים.

  • סוכנים מרובי שלבים

    המבנה שלו כולל תמיכה משופרת בהפעלת כלים חיצוניים ובדיקה עצמית של התוצאות.

  • עיבוד טקסט ארוך

    תמיכה באיתור נתונים בתוך מסמכים גדולים במסגרת חלונות הרצה רחבים דרך LMDeploy.

איפה זה נופל

ההגבלות שהמפתחים מפרטים מזהירות במפורש מפלט שעלול לכלול הטיות, אפליה או תוכן פוגעני עקב אופי ההפקה ההסתברותי. מעבר לזה, במבחני שפה וידע רחב כמו MMLU הוא עומד על 66.5, שזה נמוך יותר מ־GPT-3.5, כך שבתחומי ידע כללי והבנה רב תחומית הוא פחות מרשים מאשר במתמטיקה. שימוש בו מחייב אימות של התשובות וסינון קלט ופלט במערכות אמיתיות.

אותה משפחה

internlm2 יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ אותו על כרטיס RTX 3090 או 4090 בודד?

לא בגרסה המלאה הזו. המודל שוקל 37 ג'יגה בייט בפורמט חצי דיוק ולכן הוא יחרוג מ־24 ג'יגה הזיכרון של הכרטיס ויקרוס. כדי להריץ אותו בחומרה כזו תצטרכו לחכות לגרסאות מכווצות או להשתמש בשני כרטיסים במקביל.

האם צריך אישור מיוחד כדי להטמיע אותו במוצר של חברה?

כן, המשקלים אינם ברישיון חופשי לחלוטין. השימוש המסחרי אמנם מוגדר בחינם, אך מחייב מילוי טופס ייעודי ואישור של המפתחים לפני ההשקה.

איך מריצים

המשקל של הקבצים עומד על 37 ג'יגה בייט. כדי לטעון אותו ישירות דרך transformers בפורמט float16 חייבים כרטיס מסך עם לפחות 48 ג'יגה זיכרון, אחרת תקבלו שגיאת זיכרון מיד עם העלייה. למי שרוצה ביצועים סבירים מומלץ להרים אותו דרך LMDeploy או vLLM בגרסה 0.3.2 ומעלה, שמאפשרות לחשוף ממשק תואם OpenAI.

הטעינה מחייבת הרצת קוד מרוחק עם trust_remote_code. אם אין לכם גישה לשרת עם כרטיס A100 או שני כרטיסי 24 ג'יגה במקביל, כנראה שעדיף לצרוך מודל מרוחק מאשר לנסות להחזיק את התשתית הזו לבד.

from transformers import pipeline

pipe = pipeline("text-generation", model="internlm/internlm2-chat-20b")
print(pipe("שלום"))

הרישיון

הקוד פתוח תחת רישיון Apache-2.0, אבל המשקלים מוגדרים תחת רישיון ייעודי. המחקר האקדמי חופשי לגמרי, אך שימוש מסחרי דורש מילוי טופס בקשה מקוון מול המפתחים לצורך קבלת אישור חינמי.

הרישיון המלא בעמוד המודל ↗