GPT
I

internlm2_5-20b-chat-gguf

קוד פתוח

internlmapache-2.02024-07-29

  • gguf
  • chat
  • text-generation
  • en
  • endpoints_compatible

גרסת GGUF רשמית למודל שיחה בגודל ביניים שפונה למי שרוצה הרצה מקומית. הוא מכוון לעבודה מובנית של קריאות לפונקציות בתוך תשתיות מוכרות.

  • 136 GBמשקל הקבצים
  • 1,169הורדות בחודש
  • 39לייקים

מה זה

מדובר במודל שיחה שפותח במעבדת הבינה המלאכותית של שנחאי ומגיע ארוז מראש עבור llama.cpp. במקום להתעסק בהמרות ידניות, המאגר מציע קבצים מוכנים החל מחצי דיוק ועד קוונטיזציות שונות כמו q5_0, q5_k_m, q6_k וגם q8_0, כך שתוכלו לבחור את המשקל המתאים לפי הזיכרון שיש לכם בפועל.

הדגש המעשי שהצוות מציג בכרטיס הוא היכולת להפעיל כלים וקריאות לפונקציות באופן מובנה, דרך פורמט מוגדר מראש. ההרצה מייצרת ארגומנטים ומבנה JSON בהתאם להגדרות במערכת, ולא רק מלל חופשי. הכרטיס לא כולל ציוני מבחנים או השוואות ביצועים מול דגמים אחרים, ולכן ההבדל המרכזי כאן הוא הזמינות הטכנית של קובצי GGUF מוכנים לשימוש מיידי.

מתאים ל

  • הפעלת סוכנים וכלים מקומית

    הוא כולל מבנה מובנה לקריאה לפונקציות וייצור תשובות בפורמט מוגדר לפי סכמה.

  • שרת שיחה תואם OpenAI

    הוא נתמך ישירות על ידי llama-server ומאפשר חיבור מהיר לקוד קיים.

  • עבודה באנגלית וסינית במחשב

    הוא אומן לתקשר בשפות האלו ומגיע בגרסאות קוונטיזציה שמתאימות לזיכרון מוגבל.

איפה זה נופל

הכרטיס מגדיר מפורשות שהמודל מבין ומתקשר באנגלית ובסינית, ואין בו שום התחייבות לתמיכה בעברית. לפני שחושבים עליו עבור משתמש ישראלי, צריך לבדוק אם הוא בכלל מחזיר עברית קוהרנטית ולא שובר מילים. בנוסף, חלון ההקשר בדוגמאות מוגדר ל־4096 טוקנים, שזה טווח קצר יחסית לניתוח מסמכים כבדים. נקודה נוספת היא היעדר נתוני דיוק רשמיים בדף, כך שלא ברור כמה איכות יורדת במעבר לקוונטיזציות הנמוכות.

אותה משפחה

internlm2-5 יצא ב־5 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל יפעל טוב בעברית?

הדף הרשמי מגדיר הבנה ותקשורת שוטפת באנגלית ובסינית בלבד, והמטא־דאטה מציין אנגלית. אין הצהרה על תמיכה בעברית, ולכן צריך לבדוק אותו עצמאית לפני כל הסתמכות עליו.

איזה קובץ צריך להוריד מתוך המאגר?

המאגר כולל קבצים בפורמטים שונים. אם יש לכם כרטיס מסך חזק מאוד אפשר לקחת את גרסת fp16, אבל לרוב החומרות הביתיות עדיף לבחור קובץ מקוצץ כמו q5_k_m או q6_k שדורש פחות זיכרון.

איך מריצים

כדי להריץ אותו צריך לקמפל את llama.cpp עם תמיכה בהאצת חומרה, למשל CUDA. הכרטיס מדגים הרצה של גרסת fp16 עם העברה של 48 שכבות לכרטיס המסך וחלון הקשר של 4096 טוקנים, מה שדורש כרטיס מסך חזק מאוד. אם תרצו לחסוך בזיכרון, תצטרכו להוריד את אחת מגרסאות הקיצוץ כמו q5 או q6 במקום קובץ המשקל המלא.

אפשר להשתמש בכלי השורת פקודה llama-cli לשיחה ישירה, או להרים את llama-server שמתנהג כמו שרת מקומי תואם OpenAI. אם אין לכם חומרה ייעודית עם זיכרון וידאו שמסוגל להחזיק מודל סביב עשרים מיליארד פרמטרים, פנייה לפתרון מנוהל בענן תחסוך את כאב הראש של התקנת הסביבה וההידור.

ollama run hf.co/internlm/internlm2_5-20b-chat-gguf:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא Apache 2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי של הקבצים והפצה שלהם בתוך מוצרים. התנאי העיקרי הוא שמירה על הודעות זכויות היוצרים והרישיון המקורי, בלי חובת שיתוף של הקוד שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗