GPT
C

CausalLM-14B-GGUF

קוד פתוח

TheBlokeרישיון לא דווח2023-10-22

  • transformers
  • gguf
  • llama
  • llama2
  • qwen

גרסת GGUF למודל של 14 מיליארד פרמטרים שמציג ציונים חריגים לבנצ'מרקים בקטגוריה שלו. מתאים למי שמחפש חשיבה חזקה יחסית לגודל ויכול להריץ קבצים מקומית.

  • 49.2 GBמשקל הקבצים
  • 2,451הורדות בחודש
  • 196לייקים

מה זה

המודל הזה משלב משקולות מ־Qwen ומ־Llama 2 ועבר אימון על 1.3 מיליארד טוקנים של דאטה סינתטי בלבד. היוצרים שלו החליטו לשכתב סטים קיימים בעזרת מודלים גדולים במקום להשתמש בטקסטים גולמיים מהרשת, והוסיפו אימון ייעודי על ערכים מוויקיפדיה, Fandom ו־Moegirlpedia.

במדדים היבשים הוא מוביל על מודלים מקבילים. ב־MMLU הוא מציג דיוק ממוצע של 67.36, ובמבחן המתמטיקה של GSM8K קיבל 70.1% בניסיון ראשון, תוצאה גבוהה מ־Qwen המקורי. במבחן CEval הוא הגיע ל־73.10 ממוצע. במבחן השיחה AlpacaEval הוא השיג 88.26% ניצחונות, אבל צריך לזכור שאורך התשובה הממוצע שלו שם עמד על 1,391 מילים, מה שמטה תוצאות מהסוג הזה לטובתו.

בנוסף, הוא עבר התאמה לפורמט של LLaVA 1.5, כך שאפשר לחבר אליו מודול ViT חיצוני להבנת תמונות. חשוב לדעת שחובה לעבוד כאן עם תבנית ChatML, ושדה הוראת המערכת לא יכול להישאר ריק כדי שהפלט יהיה יציב.

מתאים ל

  • ניתוח בעיות מתמטיקה

    מציג מעל 70% ב־GSM8K, תוצאה גבוהה מאוד לגודל של 14 מיליארד פרמטרים שמתאימה לחישובים והסברים.

  • הטמעת ראייה ממוחשבת

    הותאם לפורמט של LLaVA 1.5 ומאפשר חיבור מהיר למודול תמונה חיצוני למי שבונה מערכת מולטימודלית.

  • הרצה מקומית ב־ChatML

    עובד חלק בתבנית של ChatML על מחשב אישי עם 12 עד 16 גיגה זיכרון, ללא תלות ברשת.

איפה זה נופל

המודל לא עבר שום תהליך של RLHF ולא אומן לסרב לבקשות. היוצרים מצהירים בגלוי שהאימון המקורי כלל מידע לא מסונן מהרשת, ולכן הוא עשוי לפלוט בקלות שפה פוגענית, תוכן אלים או גסויות בלי שום בלם פנימי. אם אתם מתכוונים לחשוף אותו למשתמשי קצה, אי אפשר להסתמך עליו לבד, תהיו חייבים לשים לפניו ומאחוריו מסנני מילים ובדיקות תקינות משלכם. עוד בעיה מוכרת הייתה באג בטוקנייזר שתוקן רק בגרסאות llama.cpp מאוחרות, מה שמחייב שימוש בסביבה מעודכנת.

אותה משפחה

CausalLM יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

איזה קובץ מהרשימה כדאי להוריד?

הקובץ המתאים לרוב המשתמשים הוא causallm_14b.Q4_K_M.gguf. הוא מאזן בין שמירה על רמת החשיבה של המודל לבין צריכת זיכרון סבירה של מעל 10 גיגה. גרסאות Q8 תופסות מעל 15 גיגה ולא נותנות יתרון שמצדיק את המשקל.

למה המודל מחזיר תשובות שבורות או טקסט לא הגיוני?

זה קורה משתי סיבות עיקריות. הראשונה היא שימוש בגרסה ישנה של llama.cpp שלא כוללת את התיקון לטוקנייזר מסוף אוקטובר 2023. הסיבה השנייה היא השמטה של שדה ה־system בפורמט ChatML, שהיוצרים הגדירו כחובה.

האם אפשר להשתמש במודל למוצר מסחרי?

מבחינה חוקית זה מסובך. המודל מסומן אמנם כ־WTFPL אבל בפועל הוא כבול למגבלות המסחריות של Llama 2 ושל Qwen שמהן נלקחו המשקולות. מי שרוצה להכניס אותו למוצר עסקי צריך לוודא שהוא עומד בכללים של שתי החברות.

איך מריצים

בשביל להריץ אותו דרך llama.cpp או LM Studio, לא מורידים את כל המאגר ששוקל מעל 49 גיגה־בייט אלא קובץ בודד. הקובץ המאוזן והמומלץ בדרך כלל הוא גרסת ה־4 ביט, שדורשת כ־11 גיגה־בייט זיכרון ללא פריקה למעבד הגרפי. אם יש לכם כרטיס עם 12 גיגה זיכרון וידאו, אפשר לפרוק אליו את רוב השכבות באמצעות הדגל ngl כדי לקבל מהירות עבודה טובה.

גרסאות ה־8 ביט דורשות כמעט 18 גיגה־בייט זיכרון, ופחות מומלצות בגלל יחס ביצועים מול משקל. אם אין לכם חומרה ייעודית עם לפחות 16 גיגה זיכרון ראם פנוי או מאיץ גרפי סביר, חבל להסתבך עם ריצה מקומית, פנייה לשירות מנוהל חיצוני תעלה פחות ותחסוך עבודה.

ollama run hf.co/TheBloke/CausalLM-14B-GGUF:Q4_0

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

מצב הרישוי כאן מבולגן ומסוכן לעסקים. היוצר המקורי הגדיר את הרישיון כ־WTFPL, אבל בגלל שהמשקולות מבוססות על Qwen ועל Llama 2, חלות עליו במקביל מגבלות השימוש המסחרי של מטא ושל יוצרי Qwen. אין אישור רשמי מ־Hugging Face לאופן שבו שני התנאים מסתדרים יחד, ולכן לשימוש מסחרי מדובר בהימור משפטי שלא כדאי לקחת ללא בדיקה יסודית של תנאי Llama 2.

הרישיון המלא בעמוד המודל ↗