GPT
S

Speechless-Llama2-Hermes-Orca-Platypus-WizardLM-13B-GGUF

קוד פתוח

TheBlokellama22023-09-02

  • transformers
  • gguf
  • llama
  • facebook
  • meta

מיזוג של שלושה מודלים מבוססי Llama 2 שמכוון לתת מענה מגוון בהוראות מורכבות. פתרון שמתאים למי שמחפש הרצה מקומית בפורמט GGUF בלי לשלם על חומרה כבדה מדי.

  • 91.9 GBמשקל הקבצים
  • 5,992הורדות בחודש
  • 48לייקים

מה זה

מדובר במיזוג משקלים של Nous-Hermes, OpenOrca-Platypus2 ו־WizardLM בגרסת 13 מיליארד פרמטרים, שהוסב לפורמט GGUF על ידי TheBloke. הרעיון במיזוגים כאלה הוא לקחת את יכולות השיחה וההיגיון של מספר כוונונים עדינים מובילים ולאחד אותם למודל בודד.

בכרטיס המודל המקורי מופיעה טבלת מדידות ריקה לחלוטין עבור מדדים כמו MMLU, ARC ו־HellaSwag, כך שאין שום נתון רשמי שמוכיח שהשילוב הזה אכן מנצח את המודלים שמרכיבים אותו. מה שכן מקבלים כאן זו מעטפת מוכנה לשימוש במגוון רחב של מנועי הסקה קלים, עם מבנה פקודה בסגנון Alpaca.

מתאים ל

  • עוזר מקומי באנגלית

    אינטראקציה מבוססת הנחיות במחשב אישי ללא שליחת מידע לרשת, הודות לשילוב של Hermes ו־WizardLM.

  • מענה לפי תבנית Alpaca

    ביצוע משימות טקסט מוגדרות שדורשות מבנה פקודה ותגובה מובנה ומוגדר היטב.

  • בדיקות אוטומציה בקוד

    שילוב בפרויקטים מקומיים עם פייתון דרך ספריות כמו ctransformers ללא עלויות ענן.

איפה זה נופל

היוצר השאיר את נתוני הביצועים ריקים, מה שאומר שאין שום ערבות ליציבות או לדיוק שלו מול חלופות מוכרות. המודל מתועד ומוגדר לעבודה באנגלית בלבד, ואימון הבסיס של Llama 2 מגביל אותו לעבודה בהקשר של עד 4,096 תווים. שימוש בעברית או במשימות שדורשות הקשר ארוך יוביל להזיות ולתפוקה גרועה, ולכן חובה לבדוק אותו ידנית על המשימה הספציפית שלכם לפני כל שימוש.

שאלות
נפוצות

האם אני צריך להוריד את כל הקבצים שבעמוד?

לא. העמוד מכיל 18 קבצים שונים שכל אחד מהם מייצג רמת דחיסה אחרת. אתם בוחרים קובץ אחד בלבד, למשל גרסת Q4_K_M ששוקלת 7.87 גיגהבייט ומתאימה למרבית המחשבים.

האם המודל יודע לקרוא ולכתוב בעברית?

המודל הוגדר ואומן באנגלית בלבד על בסיס Llama 2. הוא אינו מיועד לשפה העברית וניסיון להריץ עליו טקסטים מקומיים יניב תוצאות משובשות או לא מדויקות.

באיזה פורמט כותבים לו את הפקודות?

המודל דורש שימוש בתבנית הפקודה של Alpaca כדי לתפקד כראוי. זה כולל כותרת הנחיה ייעודית תחת Instruction וציפייה לפלט שמתחיל במחרוזת Response.

איך מריצים

ההרצה נעשית דרך llama.cpp, כלי ממשק כמו LM Studio או text-generation-webui, ובאמצעות ספריות פייתון דוגמת ctransformers ו־llama-cpp-python. לא מורידים את כל 91.9 הג'יגהבייט שבריפוזיטורי, אלא בוחרים קובץ בודד לפי כמות הזיכרון שיש לכם. קובץ כמו Q4_K_M שוקל 7.87 גיגהבייט ודורש 10.37 גיגהבייט זיכרון עבודה כדי לרוץ על מעבד רגיל, או כרטיס מסך עם זיכרון תואם כדי לפרוק אליו שכבות.

אם אתם מחפשים דיוק מקסימלי, גרסאות כמו Q5_K_M או Q6_K יתנו תוצאה טובה יותר אבל ידרשו מעל 11 עד 13 גיגהבייט זיכרון. אם אין לכם מעבד חזק או כרטיס מסך מתאים להרצה חלקה, עדיף להשתמש ב־API מרוחק של מודל מסחרי ולא להיאבק בזמני תגובה איטיים על חומרה מקומית.

ollama run hf.co/TheBloke/Speechless-Llama2-Hermes-Orca-Platypus-WizardLM-13B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא רישיון Llama 2 של חברת Meta. הוא מאפשר שימוש מסחרי ומחקרי חופשי, כל עוד אין לכם מעל 700 מיליון משתמשים חודשיים פעילים במוצר בעת ההשקה, ובכפוף לתנאי השימוש המקובלים של מטא שמגבילים תחומים מסוימים.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗