GPT
N

neural-chat-7b-v3-1

קוד פתוח

Intelapache-2.02023-11-14

  • transformers
  • pytorch
  • safetensors
  • mistral
  • text-generation

גרסה מכווננת של מיסטרל שאינטל אימנה על מעבדי גאודי עם שיטת DPO. מיועדת למי שמחפש מודל שבעה מיליארד פרמטרים עם ביצועים מאוזנים ורישיון חופשי לגמרי.

  • 7.2Bפרמטרים
  • 32,768טוקנים בהקשר
  • 27.0 GBמשקל הקבצים
  • 356הורדות בחודש

מה זה

אינטל לקחה את בסיס Mistral-7B-v0.1, אימנה אותו על סט הנתונים SlimOrca, וביצעה אופטימיזציה עם צמדי העדפות DPO. המטרה פה הייתה לייצר מודל שיחה קומפקטי שמתחרה ישירות בגרסאות פתוחות אחרות בגודל הזה, תוך הדגמת יכולות האימון של החומרה שלהם. הוא תומך באנגלית ומכוון למשימות יצירת טקסט כלליות.

במבחני הביצועים של הלוח הפתוח, המודל מציג ממוצע של 59.06 נקודות, שיפור משמעותי מול 50.32 של מודל הבסיס המקורי. השיפור הבולט ביותר מול מיסטרל הגולמי נרשם במבחן TruthfulQA, שבו הוא קופץ מ־42.15 ל־59.65, ובמבחן DROP שבו הוא מגיע ל־43.84 לעומת 6.14 בלבד. בגרסה הקודמת של ניורל צ'אט הייתה קריסה במבחן המתמטיקה GSM8K ל־1.21 נקודות, וכאן אינטל תיקנה את הבעיה והחזירה את הציון ל־19.56.

מתאים ל

  • בוט שיחה באנגלית

    מתאים לשירות לקוחות פנימי או עוזר וירטואלי קל, בזכות הכוונון של אינטל לשיחה וציוני אמינות סבירים יחסית לגודלו.

  • חילוץ מידע מדוחס

    מציג שיפור ניכר במבחן DROP לעומת מיסטרל המקורי, ולכן מתאים למשימות קריאה והסקת מסקנות מתוך פסקאות נתונות באנגלית.

  • הרצה מקומית מכווצת

    בגרסת INT4 הוא תופס רק 4.3 גיגה זיכרון, מה שמאפשר להריץ אותו ישירות על מחשבים אישיים או תחנות קצה ללא שרת חיצוני.

איפה זה נופל

הכרטיס מדגיש במפורש שהמודל נוטה לייצר מידע שגוי עובדתית, ולכן אי אפשר לסמוך עליו כמקור אמין לאמיתות היסטוריות או מדעיות. מעבר לזה, בגלל מגבלות המידע שעליו אומן, הוא עלול לפלוט תוכן פוגעני, גס או מוטה. אינטל מציינת ישירות שאי אפשר להכניס אותו לפרודקשן בלי להריץ בדיקות בטיחות וסינון מראש.

חשוב לשים לב גם לבלבול באורך ההקשר. המפרט הטכני מציין חלון של 32,768 טוקנים, אבל בטקסט ההסבר אינטל כותבת שההקשר מוגבל ל־8,192 טוקנים כמו מודל הבסיס. בנוסף, המודל אומן על אנגלית בלבד, ואינו כולל תמיכה מובנית בעברית.

שאלות
נפוצות

האם המודל תומך בעבודה בעברית?

הכרטיס מגדיר את שפת המודל כאנגלית בלבד, וכל נתוני האימון המוזכרים מבוססים על SlimOrca באנגלית. הוא עשוי לפלוט מילים בעברית עקב בסיס המיסטרל הרחב, אבל לא הייתי בונה עליו ליישום עסקי בעברית בלי אימון והתאמה ממוקדת מראש.

מה ההבדל בין גרסה v3 לגרסה v3-1?

ההבדל המשמעותי ביותר הוא תיקון קריסה ביכולות החישוב. בגרסה v3 הציון במבחן GSM8K נפל ל־1.21 בלבד, ובגרסה v3-1 אינטל הצליחה להעלות אותו חזרה ל־19.56, לצד שיפור קל בממוצע הכללי שהגיע ל־59.06.

איזה חומרה מינימלית נדרשת להרצה?

להרצה מלאה בדיוק 16 ביט נדרש כרטיס גרפי עם כ־16 גיגה זיכרון לפחות. אם משתמשים בכימות ל־INT4 בעזרת ההרחבות של אינטל, נפח המודל יורד ל־4.3 גיגה ואפשר להריץ אותו גם על זיכרון מערכת רגיל ומעבדי אינטל נתמכים.

איך מריצים

המשקל המלא שוקל 27 גיגה בייט בדיוק של 16 ביט, כך שבשביל להריץ אותו בלי דחיסה צריך כרטיס מסך עם לפחות 16 עד 24 גיגה בייט זיכרון. עם זאת, הכרטיס מציג דחיסה ל־INT4 שמקטיצה את נפח המודל לכ־4.3 גיגה בייט בלבד. במצב הזה אפשר להריץ אותו בקלות גם על מעבדים מקומיים או כרטיסים צרכניים פשוטים באמצעות הספריות של אינטל.

אינטל מספקת דוגמאות קוד ייעודיות לשימוש בתוספים שלה לטרנספורמרס ולפאיטורץ', עם אופטימיזציות מובנות להאצה. אם המטרה היא להריץ שירות פנימי בעומס נמוך או לבצע בדיקות מקומיות על חומרה שכבר יש לכם, ההרצה העצמית פשוטה ומשתלמת. אם אתם צריכים סקייל גבוה ואין לכם שרתי GPU או מאיצי גאודי זמינים, שכירת שרת ייעודי תהיה פחות כלכלית מפנייה לפתרונות ענן מוכנים.

from transformers import pipeline

pipe = pipeline("text-generation", model="Intel/neural-chat-7b-v3-1")
print(pipe("שלום"))

הרישיון

המודל משוחרר תחת רישיון Apache 2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי של המשקולות והפצה חופשית בתוך מוצרים. התנאים העיקריים דורשים שמירה על הקרדיט וצירוף עותק הרישיון, ללא אחריות מצד המפתחים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗