GPT
N

neural-chat-7b-v3-3

קוד פתוח

Intelapache-2.02023-12-09

  • transformers
  • pytorch
  • safetensors
  • mistral
  • text-generation

שדרוג ממוקד חישוב ומתמטיקה על בסיס מיסטרל הפופולרי, שעבר כוונון והתאמת העדפות על חומרת גאודי. מתאים למי שצריך מודל שיחה קל יחסית עם יכולת פתרון בעיות משופרת.

  • 7.2Bפרמטרים
  • 32,768טוקנים בהקשר
  • 27.0 GBמשקל הקבצים
  • 18,857הורדות בחודש

מה זה

מדובר במודל שיחה שמבוסס במקור על Mistral-7B, עבר כוונון על בסיס נתוני MetaMathQA ואופטימיזציית העדפות ישירה באמצעות זוגות נתונים של orca. התוצאה היא מודל בגודל סטנדרטי של שבעה מיליארד פרמטרים שמכוון לביצועים חזקים יותר בלוגיקה ובמתמטיקה מרוב הגרסאות המקבילות לו מאותה תקופה.

במבחני הביצועים של הלוח הפתוח הוא מגיע לממוצע של 69.83 נקודות. הנתון הבולט ביותר הוא 61.11 במבחן GSM8K לחשיבה מתמטית, ציון גבוה יחסית למודל 7B בסוף 2023, לצד ציונים יציבים בהבנת שפה והיגיון בסיסי כמו 85.26 בהלאסוואג ו־63.07 ב־MMLU.

מתאים ל

  • בוט לפתרון בעיות כמותיות

    אימון ייעודי על MetaMathQA נותן לו יתרון ברור בפתרון תרגילים וחישובים מול מודלים דומים.

  • שרת הסקה מקומי דל תקציב

    מאפשר הרצה קלה יחסית ב־INT4 על מעבדי אינטל או מאיצים זולים בלי לצאת לענן חיצוני.

  • בסיס לכוונון נוסף

    נקודת מוצא טובה למי שרוצה לאמן מודל שיחה לנישה ספציפית בעזרת קבצי המשקלים הפתוחים.

איפה זה נופל

המודל נוטה להזיות ולייצור עובדות שגויות, והיוצרים מציינים במפורש שאסור להסתמך עליו כמקור מידע עובדתי אמין. בנוסף, בגלל הדאטה־סטים שבהם השתמשו באימון, הפלט עלול להכיל הטיות, שפה בוטה או תכנים פוגעניים, מה שמחייב שכבת סינון ובדיקות בטיחות לפני שחושפים אותו למשתמשי קצה.

נקודה טכנית שדורשת תשומת לב היא אורך ההקשר. המפרט הטכני מציין 32,768 טוקנים, אך בתיעוד גוף הכרטיס נכתב שההקשר מוגבל ל־8,192 טוקנים כמו מודל הבסיס. אם האפליקציה שלכם דורשת טקסטים ארוכים במיוחד, תצטרכו לבדוק בפועל איפה הביצועים מתחילים להישבר.

שאלות
נפוצות

האם המודל חייב מעבד או מאיץ של אינטל כדי לעבוד?

לא. למרות שהוא אומן על גאודי 2 ואינטל מדגימה שימוש בכלים שלה, הוא בנוי על ארכיטקטורת מיסטרל סטנדרטית. אפשר להריץ אותו דרך ספריית transformers הרגילה על גבי כרטיסי מסך של אנבידיה.

מה אורך ההקשר האמיתי שאפשר להזין לו?

קיימת אי התאמה בין מפרט הקבצים שטוען ל־32 אלף טוקנים לבין התיעוד הכתוב שמגביל ל־8,192 טוקנים. אם המשימה שלכם כוללת מסמכים ארוכים, מומלץ להניח שהגבול הבטוח הוא 8,192 טוקנים ולבדוק את היציבות מעבר לכך.

איך מריצים

המשקלים המקוריים שוקלים 27 גיגה בייט בדיוק מלא, כך שעל כרטיס גרפי יחיד תצטרכו לפחות 16 עד 24 גיגה זיכרון כדי להריץ בביצועים סבירים. אינטל מספקת דוגמאות ריצה מותאמות לספריות שלה, כולל קוונטיזציה ל־INT4 שמאפשרת לדחוף את המודל למעבדים רגילים או למאיצים צנועים בהרבה בלי לשלם מחיר כבד במהירות.

אם אין לכם כרטיס ייעודי מקומי או שרת ענן עם חומרה מתאימה, ההתעסקות עם תלויות מקומיות של הספריות המותאמות עשויה לגזול זמן. במקרים שבהם צריכים רק שאילתות בודדות או בדיקת היתכנות מהירה, עדיף להשתמש בשרת שמריץ ממשק מרוחק במקום להרים סביבה מקומית.

from transformers import pipeline

pipe = pipeline("text-generation", model="Intel/neural-chat-7b-v3-3")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache 2.0 מלא, מה שמאפשר שימוש מסחרי, שינוי הקוד והפצה של המודל בתוך מוצרים פרטיים או ציבוריים. התנאי העיקרי הוא שמירה על הצהרת זכויות היוצרים וצירוף עותק מהרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗