GPT
V

Vikhr-Nemo-12B-Instruct-R-21-09-24

קוד פתוח

Vikhrmodelsapache-2.02024-09-20

  • transformers
  • safetensors
  • mistral
  • text-generation
  • conversational

התאמה רוסית ואנגלית למודל נמו של מיסטרל עם 12 מיליארד פרמטרים. הוא מיועד בעיקר למי שמחפש שליפת מידע מבוססת מסמכים בשפות האלה בלי להסתמך על שירותים מסחריים סגורים.

  • 12Bפרמטרים
  • 1,024,000טוקנים בהקשר
  • 24.1 GBמשקל הקבצים
  • 55,300הורדות בחודש

מה זה

הבסיס כאן הוא Mistral Nemo שעבר כוונון נוסף של צוות VikhrModels באמצעות מערכי נתונים סינתטיים ושיטת אימון שהם מכנים SMPO. הדגש המרכזי של ההתאמה הזו הוא עבודה מול מסמכים בשפות רוסית ואנגלית, לצד יכולות קוד ופתרון בעיות.

במבחני RAG מול שאלות מחוץ להקשר המסמכים, המפתחים מדווחים על דיוק שיפוט של 92 אחוזים, גבוה יותר מתוצאות של מודלים סגורים כמו gpt-4o שנמדדו על אותו מבחן. יחד עם זאת, במבחן הביצועים הכללי ברוסית עם שופט ממוחשב, 180 דוגמאות מתוך המבחן דלפו בטעות לסט האימון, כך שנתון הזכייה של 79.8 אחוזים שם מוטה כלפי מעלה ולא משקף נאמנה את המציאות.

מתאים ל

  • שליפת מידע ממסמכים ברוסית

    הוא יודע לקבל מבנה נתונים של מסמכים, להחזיר את המזהים הרלוונטיים ולענות רק מתוכם.

  • בוט תמיכה פנימי ומאובטח

    הגודל שלו מאפשר פריסה בתוך שרת ארגוני סגור ללא חשיפת שיחות החוצה לשירותי ענן.

  • סיכום ועיבוד טקסטים ארוכים

    חלון ההקשר הגדול של מודל הבסיס מאפשר לטעון פנימה כמות חומר נרחבת בבת אחת.

איפה זה נופל

למודל יש רמת בטיחות נמוכה מאוד, והמפתחים מציינים במפורש שהוא נבנה למלא הוראות ולא לסנן תוכן פוגעני או מסוכן. אם תריצו אותו בטמפרטורה גבוהה כמו 1.0 תיתקלו בעיוותים ופגמים בטקסט, ולכן חובה להגביל אותו לערכים של 0.1 עד 0.5. מצב העבודה עם מסמכים דורש פרומפט מערכת קשיח ובאנגלית בלבד, וגם אז הוא נוטה לפעמים לערבב ידע כללי קודם לתוך תשובות שאמורות להישען רק על הקבצים שסיפקתם. בנוסף, אין כאן שום התאמה מתועדת לעברית.

שאלות
נפוצות

האם המודל הזה מתאים לעבודה בעברית?

לא. המודל עבר אימון והתאמה ספציפית לרוסית ולאנגלית בלבד. כל ניסיון לעבוד איתו בעברית יפיק תוצאות ירודות ולא עקביות.

למה התוצאות במבחן הביצועים הכללי חשודות?

צוות הפיתוח ציין ש־180 שאלות מתוך מבחן ההשוואה דלפו ישירות לתוך סט נתוני האימון. המשמעות היא שהמודל שינן חלק מהמבחן מראש, והציון הגבוה שם אינו מדד אמין.

איך צריך להגדיר את הפרמטרים כדי לקבל תשובות יציבות?

היוצרים ממליצים להוריד את הטמפרטורה לטווח של 0.1 עד 0.5 ולהשתמש בערכי top_k בין 30 ל־50. מעבר לזה, פרומפט המערכת חייב להיכתב באנגלית כדי שההנחיות יתפסו טוב.

איך מריצים

המשקל המלא עומד על 24.1 גיגה בייט בפורמט bfloat16, כך שתצטרכו כרטיס מסך עם לפחות 24 גיגה זיכרון כדי לטעון אותו ישירות. אפשר להריץ אותו דרך vLLM עם פרמטרים של חצי דיוק והגבלת אורך הקשר, למשל 32,000 טוקנים, על כרטיס בודד.

אם אתם לא רוצים להחזיק שרת ייעודי שעולה כסף בכל שעה, או אם אין לכם צורך מובהק בריצה מקומית ומבודדת של נתונים, פנייה ל־API מנוהל של מודל קל תהיה פשוטה וזולה בהרבה לתחזוקה.

from transformers import pipeline

pipe = pipeline("text-generation", model="Vikhrmodels/Vikhr-Nemo-12B-Instruct-R-21-09-24")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache 2.0 מלא. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד והמשקלים, לשלב אותו במוצרים סגורים ולהפיץ אותם, בתנאי ששומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗