GPT
N

Nous-Capybara-34B-GGUF

קוד פתוח

TheBlokemit2023-11-13

  • transformers
  • gguf
  • yi
  • sft
  • Yi-34B-200K

גרסת GGUF מכווצת למודל 34B שמבוסס על Yi עם חלון של 200 אלף טוקנים. מתאים למי שרוצה שיחות ארוכות ומורכבות על חומרה מקומית חזקה.

  • 243 GBמשקל הקבצים
  • 1,666הורדות בחודש
  • 168לייקים

מה זה

מדובר בהמרה של TheBloke למודל שאימנה NousResearch על גבי תשתית Yi-34B. הייחוד העיקרי בפיתוח היה שימוש בדאטה־סט קטן יחסית של 20 אלף דוגמאות שרובן שיחות מרובות שלבים, מעל 60 אחוז מהן, עם ממוצע של מעל אלף טוקנים לדוגמה. המטרה הייתה לחדד יכולות סיכום מורכבות ודיונים ארוכים בלי לאבד את ההקשר.

בסיס המודל תומך בחלון הקשר של עד 200K, נתון חריג לקטגוריית המשקל הזו. הדאטה שולב מחומרים סינתטיים ומקורות כמו דיונים מאתר LessWrong על רציונליות ופילוסופיה, לצד משימות סיכום של מחקרים מתקדמים. מידע הרקע שלו מעודכן עד סוף שנת 2022 ללא גישה לרשת.

מתאים ל

  • סיכום מסמכים ארוכים

    אימון ייעודי על מאות משימות סיכום עמוקות מאפשר לפרק דוחות טכניים ומחקרים בלי לאבד פרטים.

  • עוזר שיחה רב־שלבי

    רוב הדאטה נבנה משיחות שלמות עם מעל אלף טוקנים, ולכן הוא זוכר את השתלשלות הדיון טוב ממודלים פשוטים.

  • דיוני עומק והיגיון

    שילוב טקסטים מאתר LessWrong נותן מענה מפורט בנושאי רציונליות ופילוסופיה.

איפה זה נופל

המודל אומן על אנגלית בלבד. בעברית הוא כנראה יגמגם, יערבב תחביר או פשוט יסרב לתפקד ברמה סבירה. נוסף לכך, היוצרים עצמם מציינים שבמאגר הנתונים עלולות להיות תשובות שגויות מבחינה מתמטית ומדעית, והם פנו למתנדבים עם תארים מתקדמים כדי לנקות טעויות כאלה בעתיד. אל תסמכו עליו לחישובים מדויקים או להסקת מסקנות מדעיות קריטיות.

שאלות
נפוצות

כמה זיכרון מחשב צריך בשביל להריץ אותו?

הקובץ המאוזן ביותר, Q4_K_M, דורש מעל 23 גיגה־בייט ראם פנוי. אם רוצים להריץ אותו חלק על כרטיס מסך, תצטרכו לפחות 24 גיגה VRAM כדי להוריד אליו את השכבות. גרסאות קלות יותר כמו Q2 או Q3 יסתפקו בכ־17 עד 19 גיגה, אבל יסבלו מירידה מורגשת באיכות הפלט.

האם המודל מבין ומייצר עברית?

לא. המודל הוגדר ואומן באנגלית בלבד. חבל לבזבז זמן הורדה ומשאבי מחשוב אם מטרת השימוש שלכם היא ממשק או עיבוד מסמכים בעברית.

איך מריצים

כדי להריץ אותו צריך קובץ בודד מתוך המאגר, בהתאם לחומרה שלכם. גרסת האיזון המומלצת, Q4_K_M, שוקלת כמעט 21 גיגה־בייט ודורשת לפחות 23.2 גיגה זיכרון כדי לרוץ על מעבד וראם בלבד. אם יש לכם כרטיס מסך עם 24 גיגה VRAM תוכלו לטעון את רוב השכבות ישירות אליו עם llama.cpp ולקבל מהירות סבירה.

עבור גרסאות איכותיות יותר כמו Q5_K_M תצטרכו מעל 26 גיגה זיכרון, וקובץ ה־Q8 מגיע ליותר מ־36 גיגה. במערכות עם פחות מ־32 גיגה ראם עדיף לא לנסות בכלל, ושם כבר משתלם יותר להשתמש בשירות ענן או לקרוא למודל דרך ספק חיצוני.

ollama run hf.co/TheBloke/Nous-Capybara-34B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

רישיון MIT פתוח ומתירני לחלוטין. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להפיץ אותו מחדש ולשלב אותו בקוד סגור. התנאי היחיד הוא שמירת הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗