GPT
C

c4ai-command-r-plus-GGUF

קוד פתוח

pmyslcc-by-nc-4.02024-04-04

  • gguf
  • text-generation
  • endpoints_compatible
  • conversational

גרסת GGUF שמאפשרת להריץ את המודל הענק של Cohere מקומית דרך llama.cpp. היא מיועדת למי שחייב מודל שיחה חזק אצלו בשרת ולא מוכן להוציא מידע החוצה לענן.

  • 1.2 TBמשקל הקבצים
  • 2,107הורדות בחודש
  • 43לייקים

מה זה

המאגר הזה לוקח את Command R פלוס, מודל שמיועד למשימות טקסט ושיחה, וממיר אותו למבנה שמתאים להרצה מקומית. כדי שהמודל ייכנס למחשבים רגילים יותר או לשרתים עם זיכרון מוגבל, יצרו כאן גרסאות מכווצות שונות בעזרת מטריצת חשיבות ייעודית, שנועדה לשמר את איכות הפלט גם כשדוחסים את המשקלים.

מבחני הפרפלקסיטי על wikitext-2 מראים בדיוק את המחיר של הדחיסה. גרסת המקור f16 עומדת על 4.38, גרסת Q4_K_M קרובה אליה מאוד עם 4.46, וגרסת Q3_K_L מגיעה ל־4.62. כשצוללים עמוק יותר לכיבוץ של Q2_K, הציון קופץ ל־5.71, מה שמעיד על ירידה חדה ביכולת של המודל לייצר טקסט הגיוני ועקבי, ולכן עדיף להתרחק ממנה.

מתאים ל

  • מחקר וניסויי שפה

    הרצת בדיקות מקומיות על מודל שיחה רחב בלי לחשוף נתונים רגישים לשירותי צד שלישי.

  • בדיקת איכות כיווצים

    השוואת ביצועים ורמת דיוק בין רמות קוונטיזציה שונות בסביבת בדיקה מקומית.

  • בניית אבות טיפוס

    פיתוח ממשקי שיחה פנימיים בארגון שאינם מיועדים למכירה או למטרות רווח מסחריות.

איפה זה נופל

החיסרון המרכזי שרואים במדידות הוא הפגיעה הקשה באיכות ברמות הכיווץ הנמוכות. גרסת Q2_K מאבדת דיוק בצורה בולטת לעומת המקור, ולכן אי אפשר לסמוך עליה למשימות רגישות. מעבר לזה, המאגר מספק רק את המשקלים עצמם בלי שום נתוני ביצועים על משימות כמו שליפת מידע או שימוש בכלים חיצוניים. המשמעות היא שאתם צריכים לבדוק בעצמכם איך הכיווץ משפיע על המשימה הספציפית שלכם, במיוחד בגרסאות הדחוסות שנוטות לייצר יותר הזיות וטעויות.

שאלות
נפוצות

האם צריך לאחד את הקבצים המפוצלים לפני ההרצה?

לא. גרסאות עדכניות של llama.cpp מזהות את החלקים לבד. מספיק לציין את הנתיב לחלק הראשון והשאר ייטענו אוטומטית.

באיזו גרסת כיווץ כדאי לבחור לשימוש יומיומי?

גרסת Q4_K_M מציגה את האיזון הטוב ביותר בין גודל הקובץ לציון הפרפלקסיטי. היא קרובה מאוד למקור f16 וחוסכת נפח זיכרון משמעותי.

איך מריצים

כדי לעבוד איתו צריך עותק של llama.cpp מגרסה b2636 ומעלה. הקבצים הגדולים פוצלו לחלקים, אבל אין צורך לאחד אותם ידנית לפני הטעינה, מספיק לכוון את הפקודה לקובץ הראשון ברצף והמערכת תטען את שאר החלקים לבד ישירות לזיכרון.

סך כל הקבצים במאגר שוקל 1.2 טרה בייט, וגם קובץ בודד דורש עשרות ג'יגה בייט של זיכרון עבודה כדי לעלות. אם אין לכם שרת ייעודי עם מעבדים גרפיים חזקים או כמות זיכרון עצומה, המודל הזה יזחל או יקרוס. במקרים כאלה עדיף לפנות ישירות לשירות ענן בתשלום במקום לנסות להחזיק תשתית כבדה כל כך בעצמכם.

ollama run hf.co/pmysl/c4ai-command-r-plus-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

42 קבצים במאגר, 1.2 TB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון כאן הוא cc-by-nc-4.0, וזה אומר דבר פשוט מאוד. מותר להוריד, להריץ, לשנות ולבדוק את המודל לצרכי מחקר, לימוד ופיתוח עצמי, אבל חל איסור מוחלט להשתמש בו לכל מטרה מסחרית או להטמיע אותו במוצר שמכניס כסף.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗