GPT
C

c4ai-command-r-plus-iMat.GGUF

קוד פתוח

dranger003cc-by-nc-4.02024-04-04

  • gguf
  • text-generation
  • endpoints_compatible
  • imatrix
  • conversational

גרסת כימות של מודל ענק עם 104 מיליארד פרמטרים שמתמחה בשימוש בכלים ומשימות אחזור. מתאים למי שרוצה ביצועים ברמה גבוהה מקומית ומוכן לשלם במשאבי חומרה כבדים.

  • 1.2 TBמשקל הקבצים
  • 2,188הורדות בחודש
  • 140לייקים

מה זה

מדובר בהמרה לפורמט GGUF של המודל מבית Cohere For AI, שבוצעה באמצעות מטריצת חשיבות כדי לצמצם את אובדן הדיוק בכימותים הנמוכים. המודל מיועד לעבודה מתקדמת של שילוב כלים מרובים ברצף, משימות אחזור מידע, ניתוח טקסט ארוך וסיכום. הוא נבנה עם חלון הקשר של 131,072 טוקנים ומכיל 64 שכבות.

מדדי הפרפלקסיטי שנבדקו מראים פערים חדים בין הגרסאות. בכימותים האגרסיביים של ביט אחד כמו IQ1_S השגיאה מזנקת ב־88.23% ביחס למקור, מה שהופך את הפלט לבעייתי מאוד. לעומת זאת, החל מ־IQ4_XS הפער יורד ל־1.33% בלבד, ובגרסאות כמו Q5_K_S או Q6_K איכות הטקסט זהה לחלוטין לקובץ המקורי של 16 ביט, כך שאין צורך לסחוב את המשקל המלא.

מתאים ל

  • הפעלת כלים מרובי שלבים

    הארכיטקטורה תוכננה לקרוא לפונקציות ולחבר תוצאות מכמה כלים שונים ברצף לצורך פתרון בעיה.

  • מחקר מקומי של RAG

    מאפשר לבדוק תהליכי אחזור מידע על חלון הקשר ענק של 131K טוקנים בלי לשלוח נתונים החוצה.

  • ניתוח מסמכים ארוכים

    בכימותים של IQ4 ומעלה מקבלים יכולת סיכום והסקה מטקסטים ארוכים ברמה קרובה מאוד למודל המקורי.

איפה זה נופל

החיסרון המרכזי כאן הוא המחיר החומרתי מול איכות הפלט בכימותים הנמוכים. מתחת ל־IQ3 הירידה בדיוק מורגשת מאוד והמודל מאבד את היכולת לעקוב אחרי הוראות מורכבות. בנוסף, המודל עבר הערכת ביצועים רשמית בעשר שפות בלבד, ועברית אינה אחת מהן. המשמעות היא שהבנת עברית, ובטח שימוש בכלים וניתוח טקסטים מקומיים, דורשים בדיקה מעמיקה ולא מובטחים ברמה גבוהה.

שאלות
נפוצות

איזה כימות הכי כדאי להוריד?

האיזון המוצלח ביותר נמצא ב־IQ4_XS ששוקל כ־52.34 גיגה בייט ומציג סטייה של 1.33% בלבד ממודל ה־FP16. אם המקום לוחץ, IQ3_M ב־44.41 גיגה בייט שומר על איכות סבירה עם סטייה של כ־5.38%. מומלץ להתרחק מכימותי ביט אחד או שניים אלא אם המטרה היא בדיקת היתכנות טכנית בלבד.

איך מחברים את הקבצים המפוצלים של המודל?

לא צריך להשתמש בכלים חיצוניים או לאחד את הקבצים לקובץ אחד גדול. מעבירים לפקודת ההרצה של llama.cpp את הנתיב של הקובץ הראשון ברצף, והספרייה מזהה וטוענת את שאר החלקים לבד.

איך מריצים

כדי להריץ אותו צריך גרסה מעודכנת של llama.cpp שתומכת בטוקניזציית BPE של המודל. בגלל הגודל העצום, הקבצים מפוצלים למספר חלקים. אין צורך לאחד אותם ידנית מראש, אלא רק להעביר את הנתיב של הקובץ הראשון לדגל הטעינה והתוכנה תמשוך את השאר אוטומטית.

המשקלים נעים בין 21.59 גיגה בייט בכימות הנמוך ביותר ועד מעל 102 גיגה בייט ב־Q8_0. כדי להריץ כימות שפוי כמו IQ3 או IQ4 צריך לפחות 48 עד 64 גיגה בייט של זיכרון וידאו ייעודי, או שילוב כבד של זיכרון מערכת מהיר עם פגיעה קשה בקצב היצירה. אם אין לכם תחנת עבודה עם כמה כרטיסים גרפיים חזקים, הרצה דרך שירות מנוהל תהיה זולה ומעשית בהרבה.

ollama run hf.co/dranger003/c4ai-command-r-plus-iMat.GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

42 קבצים במאגר, 1.2 TB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא cc-by-nc-4.0. המשמעות פשוטה: השימוש מותר למטרות מחקר, ניסויים אישיים ופיתוח פנימי בלבד. אסור לשלב את המשקלים או להריץ אותם בתוך מוצר מסחרי, שירות שגובה תשלום או פעילות עסקית מניבה.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗