GPT
O

openchat_3.5-GGUF

קוד פתוח

TheBlokeapache-2.02023-11-02

  • transformers
  • gguf
  • mistral

גרסת GGUF מכווצת למודל קוד פתוח בגודל שבעה מיליארד פרמטרים. היא נועדה למי שרוצה ביצועים של צ'אט מתקדם מקומית על מעבד או כרטיס מסך ביתי.

  • 51.2 GBמשקל הקבצים
  • 1,963הורדות בחודש
  • 133לייקים

מה זה

המאגר מכיל קבצים מכווצים של מודל OpenChat 3.5 בגודל שבעה מיליארד פרמטרים, המבוסס על ארכיטקטורת Mistral ואומן בשיטת C-RLFT על נתונים באיכות מעורבת. המטרה כאן היא לספק איכות שיחה שמזכירה שירותים סגורים, אבל בתוך משקל שמאפשר הרצה מקומית בלי חומרה ארגונית.

במבחנים שמציגים היוצרים, הוא הגיע לציון ממוצע של 61.6 מול 61.5 של ChatGPT מגרסת מרץ, וקיבל 7.81 במדד MT-Bench. המספרים האלה מראים שהוא מתמודד יפה מאוד עם שאלות רב שלביות וכתיבה, ומציג תוצאות גבוהות יותר ממודלים פתוחים אחרים בגודל דומה, כמו מיסטרל הבסיסי שקיבל 6.84 באותו מבחן.

מתאים ל

  • עוזר שיחה מקומי

    ניהול שיחות שוטפות ותשובות למשתמשים על חומרה מקומית ללא תלות בשרת חיצוני.

  • הפעלת בוט תמיכה

    מתאים לשירות לקוחות ראשוני בזכות ציונים גבוהים בבדיקות דיאלוג ושיחה.

  • כתיבת קוד פשוט

    מצב הקוד הייעודי יודע לייצר סקריפטים וממשקי רשת בסיסיים ישירות מהפרומפט.

איפה זה נופל

היוצרים מודים שהמודל יורש את המגבלות של מודל הבסיס שלו, בעיקר בהסקה לוגית מורכבת, מתמטיקה ופתרון בעיות תכנות כבדות. הוא נוטה להזיות ולייצור עובדות שגויות, ולכן אי אפשר לסמוך עליו בעיניים עצומות במוצר שדורש דיוק עובדתי. בנוסף, אין לו מנגנוני סינון מובנים הרמטיים, והוא עלול לייצר תוכן פוגעני או מוטה אם לא עוטפים אותו בשכבת בדיקות חיצונית.

שאלות
נפוצות

איזה קובץ בדיוק צריך להוריד מתוך המאגר?

לרוב המשתמשים מומלץ להוריד רק את openchat_3.5.Q4_K_M.gguf. הוא נותן את הפשרה הטובה ביותר בין מהירות, ניצול זיכרון ואיכות הפלט. אין שום סיבה להוריד את כל המאגר ששוקל מעל חמישים גיגה בייט.

האם המודל תומך בחלון הקשר ארוך?

המודל מגיע עם תמיכה בחלון הקשר של עד 8192 תווtokenים. כלי ההרצה llama.cpp יודע לקרוא את הגדרות ההקשר ישירות מקובץ ה־GGUF, אך חלון מלא צורך זיכרון עבודה נוסף מעבר למשקל הבסיסי של המודל.

איך מריצים

כדי להריץ אותו צריך קובץ בודד בלבד. הגרסה המאוזנת והמומלצת, Q4_K_M, שוקלת 4.37 גיגה בייט ודורשת לפחות 6.87 גיגה בייט זיכרון כדי לרוץ על המעבד, או כרטיס מסך מודרני עם שמונה גיגה בייט זיכרון כדי לטעון את כל השכבות לתוכו. אם החומרה חלשה יותר אפשר לקחת את גרסאות שתיים או שלוש ביט, אבל המחיר באיכות התשובות מורגש מיד.

מריצים את הקובץ ישירות דרך llama.cpp, תוכנות כמו LM Studio או בספריות פייתון כמו ctransformers. חייבים להקפיד על תבנית הפרומפט הספציפית של המודל, שמשתמשת בקידומות GPT4 User ו־GPT4 Assistant, אחרת הפלט מתחרבש.

ollama run hf.co/TheBloke/openchat_3.5-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הפרויקט מופץ תחת רישיון Apache 2.0. הרישיון הזה מתיר שימוש מסחרי מלא, שינוי של הקוד והמשקלים והפצה של המערכת בתוך מוצרים, כל עוד שומרים על הודעת זכויות היוצרים ונוסח הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗