GPT
C

CausalLM-7B-GGUF

קוד פתוח

TheBlokewtfpl2023-10-22

  • transformers
  • gguf
  • llama
  • llama2
  • qwen

גרסת כימות של מודל שבעה מיליארד פרמטרים שזוקק מגרסת 14B ותומך באנגלית ובסינית. המפתחים שלו יצרו אותו בעיקר כמודל עזר לטכניקת דגימה משוערת, spec sampling.

  • 55.7 GBמשקל הקבצים
  • 2,385הורדות בחודש
  • 64לייקים

מה זה

מדובר במודל שנוצר משילוב משקולות של Qwen ושל LLaMA2, ומבוסס על הארכיטקטורה של LLaMA2. האימון שלו נשען על 1.3 מיליארד טוקנים של מידע סינתטי ושכתובים, יחד עם ערכים מוויקיפדיה, Fandom ו־Moegirlpedia, במטרה לשמור על ביצועים גבוהים בגודל קומפקטי. הוא יודע לעבוד באנגלית ובסינית, ומגיע בפורמט ChatML שדורש הגדרת הוראת מערכת כדי לעבוד נכון.

במדדי הביצועים שהוצגו בכרטיס המקורי, הוא הציג ממוצע של 63.82 במבחן MMLU ודיוק ממוצע של 70.27 במבחן CEval לסינית. במבחן החשבון GSM8K הוא השיג 59.2 אחוז בדיוק אפס צעדים. המספרים האלה מראים יכולת חזקה בהבנת שפה טבעית ופתרון שאלות יחסית לגודל שבעה מיליארד, אם כי היוצרים עצמם מציינים שהגרסה הזו נבנתה במקור כמנגנון זיקוק עבור המודל הגדול יותר ולא כמנוע ראשי יחיד.

מתאים ל

  • דגימה משוערת במערכות קיימות

    הוא תוכנן במקור כמודל טיוטה קל לזירוז הפלט של CausalLM 14B.

  • עיבוד טקסט באנגלית ובסינית

    אימון המודל כולל בסיס רחב בשתי השפות האלו ומתאים למשימות דו־לשוניות מקומיות.

  • הרצה מקומית על מחשב ביתי

    פורמט GGUF מאפשר הפעלה חלקה עם פחות משמונה ג'יגה זיכרון עבודה ללא תלות ברשת.

איפה זה נופל

היוצרים מדגישים בפירוש שהמודל נוטה להזיות ולפלט לא אמין אם מסתמכים עליו ישירות ללא בדיקה, כיוון שהוא מותאם לדגימה משוערת ולא לשיחה חופשית. בנוסף, הוא אומן על מידע גולמי ללא סינון תוכן, ללא אימון באמצעות משוב אנושי, RLHF, וללא דוגמאות שמסרבות לענות. המשמעות היא שהוא עלול לפלוט תוכן פוגעני, מיני או אלים, ויש להפעיל מנגנון סינון מילים עצמאי בצד שלכם. בעברית הוא אינו נתמך כלל בחומרי האימון הרשמיים.

אותה משפחה

CausalLM יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם חובה להזין הוראת מערכת בכל בקשה?

כן. היוצרים ציינו מפורשות בתבנית ChatML שהשדה system אינו יכול להישאר ריק, ויש להגדיר אותו כדי שהמודל ייצר פלט יציב ועקבי.

איזה קובץ כדאי להוריד מתוך כל האפשרויות?

עדיף לבחור ב־causallm_7b.Q4_K_M.gguf או ב־Q5_K_M. שאר הגרסאות נמוכות מדי באיכות התוכן או כבדות ללא שיפור משמעותי.

האם המודל בטוח לשימוש מול לקוחות קצה?

לא ללא שכבת סינון נוספת. המודל לא עבר תהליכי התאמה אתיים או RLHF, ולכן מחייב בדיקות אבטחה וסינון מילות מפתח לפני שחושפים אותו למשתמשים.

איך מריצים

המודל רץ ישירות דרך llama.cpp, ממשקי משתמש כמו LM Studio או text-generation-webui, וספריות פייתון דוגמת ctransformers ו־llama-cpp-python. דפי המודל מציעים קבצים בכימותים שנעים בין 2 ביט ל־8 ביט. לרוב השימושים, קובץ Q4_K_M בגודל 4.77 ג'יגה שדורש כ־7.27 ג'יגה זיכרון נותן את הפשרה הטובה ביותר בין איכות ומשאבים. למי שרוצה איכות מקסימלית בלי זליגת זיכרון חריגה, מומלץ לבחור ב־Q5_K_M ששוקל 5.53 ג'יגה.

כדי להריץ אותו מקומית, מספיק מחשב אישי עם 8 עד 16 ג'יגה זיכרון עבודה, ואפשר להעביר את השכבות לכרטיס מסך ביתי עם 8 ג'יגה זיכרון ייעודי כדי לקבל מהירות טובה. אם המטרה היא להריץ משימות שאינן תלויות בסינית או בדגימה מקומית, עדיף להשתמש ב־API מנוהל של מודלים מודרניים כדי לחסוך תחזוקה, שכן המודל הזה אינו כולל מנגנוני בטיחות מוכנים.

ollama run hf.co/TheBloke/CausalLM-7B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הרשום בכרטיס הוא wtfpl, שמתיר כל שימוש ללא תנאים. יחד עם זאת, המודל משתמש במשקולות של LLaMA2 ושל Qwen, ולכן כפוף גם לתנאי הרישיון המסחריים והמגבלות של מטא ועליבאבא. כל מי שמתכנן להפיץ אותו בתוך מוצר מסחרי צריך להביא בחשבון את המגבלות של מודלי המקור ולא להסתמך רק על ההצהרה החופשית.

הרישיון המלא בעמוד המודל ↗