GPT
I

internlm2_5-20b-chat

קוד פתוח

internlmother2024-07-30

  • transformers
  • safetensors
  • internlm2
  • feature-extraction
  • text-generation

גרסת שיחה בקנה מידה של עשרים מיליארד פרמטרים שמתמקדת בהפעלת כלים ופתרון בעיות מתמטיות. היא מיועדת למי שצריך יכולות חשיבה מורכבות על שרת מקומי חזק.

  • 20Bפרמטרים
  • 32,768טוקנים בהקשר
  • 37.0 GBמשקל הקבצים
  • 1,542הורדות בחודש

מה זה

הארכיטקטורה מבוססת על עשרים מיליארד פרמטרים עם חלון הקשר של 32,768 טוקנים וארבעים ושמונה שכבות. המפתחים הדגישו בו יכולות חזקות של הפעלת כלים חיצוניים, מעקב אחרי הוראות מורכבות, ואיסוף מידע מרובה מקורות ברשת במסגרת סוכני בינה מלאכותית.

במבחני הביצועים של OpenCompass הוא עוקף את Gemma2-27B במבחן המתמטיקה עם ציון של 64.7 לעומת 50.1, ומשיג 76.3 במבחן BBH לעומת 71.5. המשמעות היא יכולת ניתוח והסקה טובה יותר ממה שמקובל למצוא בגדלים האלה, אם כי במבחן הידע הכללי MMLU הוא עומד על 73.5, מעט מתחת ל־75.0 של המודל המתחרה.

המשקל הגולמי של הקבצים עומד על 37 ג'יגה בייט. זה מציב אותו בנקודת ביניים בין מודלים קלים של שבעה מיליארד פרמטרים לבין מפלצות של שבעים מיליארד, כשהדגש הברור הוא על לוגיקה וקריאה לפונקציות.

מתאים ל

  • סוכנים אוטונומיים ברשת

    איסוף מידע מורכב מעשרות מקורות וניתוח הנתונים תוך שימוש במנגנוני ביקורת פנימיים.

  • פתרון בעיות חישוביות

    ניתוח שלבי בעיות מתמטיות בזכות ציון של 64.7 במבחן MATH.

  • שרת שאלות ותשובות פרטי

    הרצה מקומית בארגון שדורש חלון הקשר של עד שלושים ושניים אלף טוקנים ללא ענן חיצוני.

איפה זה נופל

הכרטיס מזהיר במפורש מפני פלט שאינו תואם את הציפיות, כולל הטיות ותכנים פוגעניים הנובעים מאופי הפעולה ההסתברותי של המערכת. במבחן GPQA המודל משיג 33.3 בלבד, מה שמראה שאלות מומחים בתחומים מדעיים עדיין מקשות עליו מאוד.

הריצה מחייבת הרצת קוד צד שלישי לא מוכר בסביבת הפייתון שלכם באמצעות trust_remote_code. אם אתם בונים עליו למענה בשפה העברית, אין בתיעוד שום נתון על ביצועים בשפות שאינן אנגלית או סינית, ולכן נדרשת בדיקה יסודית לפני שמשלבים אותו בזרימת עבודה.

אותה משפחה

internlm2-5 יצא ב־5 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ אותו על כרטיס מסך ביתי בודד?

לא בגרסה הרגילה שלו. המשקל המלא תופס 37 ג'יגה בייט ודורש חומרה ברמת תחנת עבודה, אלא אם תורידו גרסה מכווצת בפורמט GGUF שתתאים לכרטיס של 16 או 24 ג'יגה בייט.

האם המודל מוכן לשימוש ישיר באפליקציה מסחרית?

הרישיון מאפשר שימוש מסחרי בחינם, אך חובה להגיש טופס בקשה רשמי למפתחים בטרם הפריסה. בנוסף תצטרכו להפעיל מנגנוני סינון עצמאיים, מאחר שהמפתחים מזהירים מפני פלט בעייתי ולא לוקחים עליו אחריות.

איך מריצים

המשקל בפורמט חצי דיוק דורש כרטיס גרפי של 48 ג'יגה בייט זיכרון כדי להיטען במלואו, או שילוב של שני כרטיסים צרכניים חזקים. טעינה בסיסית דרך ספריית שנאים מחייבת ציון מפורש של float16 כדי למנוע קריסת זיכרון, וכן הפעלה של trust_remote_code.

אם התקציב או החומרה שלכם לא מגיעים למדרגה הזו, קיימות גרסאות קוונטיזציה של GGUF כמו q5 או q8 שמאפשרות דחיסה משמעותית. לשרת שירות פעיל, מומלץ להריץ דרך ספריות ייעודיות כמו vLLM או LMDeploy שפותחה יחד עם הפרויקט, ומקימות שרת תואם ממשק OpenAI.

from transformers import pipeline

pipe = pipeline("text-generation", model="internlm/internlm2_5-20b-chat")
print(pipe("שלום"))

הרישיון

הקוד פתוח תחת רישיון Apache-2.0, אבל המשקולות עצמן מוגדרות תחת רישיון מותאם אישית. הן פתוחות לחלוטין לצורכי מחקר אקדמי. שימוש מסחרי מותר ללא תשלום, אך הוא מחייב מילוי טופס בקשה מקוון ואישור של המפתחים.

הרישיון המלא בעמוד המודל ↗