GPT
N

neural-chat-7B-v3-1-GGUF

קוד פתוח

TheBlokeapache-2.02023-11-15

  • transformers
  • gguf
  • mistral

גרסה מכווצת של המודל מבית אינטל שמתאימה להרצה על מעבד או כרטיס ביתי. פתרון טוב למי שרוצה שיחה והיגיון בסיסי במחשב מקומי בלי תלות ברשת.

  • 51.2 GBמשקל הקבצים
  • 1,393הורדות בחודש
  • 61לייקים

מה זה

מדובר בהמרה של הדגם של אינטל לפורמט GGUF, שמיועד לעבודה מקומית ומהירה. אינטל לקחו את Mistral 7B המקורי, אימנו אותו על מאגר SlimOrca ועשו כיוונון עדין עם אלגוריתם DPO כדי לשפר את ההיענות להוראות ואת איכות השיחה. התוצאה היא מודל שיחה שמתמודד טוב עם הנחיות מורכבות יחסית לגודלו.

בבדיקות הביצועים של הלוח הציבורי, הוא מציג ממוצע של 59.06 לעומת 50.32 של מודל הבסיס. השיפור הניכר ביותר נרשם במבחני חשיבה כמו ARC עם ציון של 66.21 ודיוק תשובות ב־TruthfulQA עם 59.65. המשמעות היא פחות הזיות ויותר יציבות במתן תשובות ישירות, אם כי במבחני מתמטיקה כמו GSM8K הוא עדיין מוגבל למדי ומגיע ל־19.56 בלבד.

מתאים ל

  • עוזר מקומי למחשב אישי

    רץ ישירות על מעבד ומספק מענה לשאלות וניסוח טקסט בלי לשלוח מידע החוצה.

  • עיבוד פקודות בפורמט מובנה

    אימון SlimOrca הופך אותו לטוב בהבנת הוראות מערכת ומעקב אחרי הנחיות.

  • שרת צ'אט פנימי לחברות

    מתאים לשרת פנימי דל תקציב עם כרטיס מסך פשוט בזכות גרסאות 4 ביט חסכוניות.

איפה זה נופל

היוצרים מודים בפירוש שהמודל נוטה לייצר שגיאות עובדתיות ולא מתאים כמקור אמין למידע מדויק. הוא אומן בין ספטמבר לאוקטובר 2023, ולכן הוא לא מכיר אירועים מאוחרים יותר. בנוסף, בגלל בסיס הנתונים שעליו הוא נבנה, הוא עלול לפלוט תוכן פוגעני או מוטה, כך שחובה להוסיף שכבת סינון לפני חיבור למשתמשי קצה. גם היכולת החישובית שלו חלשה מאוד לפי מבחני המתמטיקה.

שאלות
נפוצות

איזה קובץ בדיוק צריך להוריד מהרשימה?

הקובץ המומלץ לרוב השימושים הוא neural-chat-7b-v3-1.Q4_K_M.gguf. הוא שוקל 4.37 גיגהבייט, רץ בצורה חלקה על כמעט כל מחשב מודרני ושומר על רמת דיוק קרובה למקור.

האם חייבים כרטיס מסך של Nvidia כדי להפעיל אותו?

לא, קובצי GGUF מיועדים לעבודה גם על מעבד רגיל בלבד דרך זיכרון ה־RAM. כרטיס מסך פשוט יאיץ את קצב פליטת המילים, אבל המודל יגיב היטב גם במחשב ללא מעבד גרפי ייעודי.

איך מריצים

בשביל להריץ אותו צריך רק מחשב סביר ותוכנה כמו llama.cpp, LM Studio או ספריית ctransformers בפייתון. אין צורך להוריד את כל 51.2 הג'יגהבייט של המאגר. בוחרים קובץ אחד לפי החומרה שיש לכם. הגרסה המאוזנת והמומלצת לרוב המשתמשים היא Q4_K_M, ששוקלת 4.37 גיגהבייט ודורשת בערך 6.87 גיגהבייט זיכרון כדי לפעול כולה על המעבד, או כרטיס מסך בסיסי עם 6 עד 8 גיגהבייט זיכרון כדי לפרוק אליו שכבות.

אם יש לכם זיכרון פנוי אפשר לעלות ל־Q5_K_M ששוקל 5.13 גיגהבייט ומשפר מעט את הדיוק. בגרסאות הנמוכות כמו Q2 או Q3 לא הייתי נוגע בגלל אובדן איכות מורגש. להרצה מקומית על לפטופ זה עובד מצוין, אבל לשירות עם אלפי פניות בו זמנית עדיף לשלם על API חיצוני.

ollama run hf.co/TheBloke/neural-chat-7B-v3-1-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא apache-2.0, שמתיר שימוש מסחרי, שינוי והפצה של הקוד והמשקלים ללא תשלום תמלוגים. אתם יכולים לשלב אותו במוצר שלכם, בתנאי שתשמרו על הקרדיט והודעת הרישיון המקורית. הכרטיס כולל הבהרה משפטית של אינטל שממליצה להתייעץ עם עורך דין לפני פריסה מסחרית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗