GPT
U

una-cybertron-7b-v2-bf16

קוד פתוח

fblgitapache-2.02023-12-02

  • transformers
  • safetensors
  • mistral
  • text-generation
  • juanako

גרסת כוונון עדין על בסיס מיסטרל שמכוונת למקסימום ביצועים במבחני לוגיקה ומתמטיקה. מתאימה למי שמחפש משקל קל של שבעה מיליארד פרמטרים עם תוצאות תחרותיות במבחני ביצועים.

  • 7.2Bפרמטרים
  • 32,768טוקנים בהקשר
  • 13.5 GBמשקל הקבצים
  • 72הורדות בחודש

מה זה

הבסיס כאן הוא Mistral 7B שעבר אימון עם שילוב של SFT, DPO ושיטה שהמפתח מכנה UNA, ראשי תיבות של Uniform Neural Alignment. לפי התיאור לא מדובר באיחוד שכבות פשוט כמו SLERP, אלא בטכניקת יישור שאומנה על גבי מעבדי H100 בכמה שעות בודדות. המטרה המוצהרת של הפרויקט הייתה להגיע לראש טבלת הדירוג של המודלים הפתוחים, והוא אכן הגיע לממוצע של 69.67 במבחנים הרשמיים.

התוצאות מראות שיפור ניכר מול מודל הבסיס של מיסטרל במבחני חשיבה, במיוחד בציון TruthfulQA שעומד על 64.63 לעומת 42.15 במקור, ובמבחן המתמטיקה GSM8K שמגיע ל־55.04 לעומת 37.83. המשמעות היא יכולת מעקב טובה יותר אחרי הנחיות והפחתת הזיות ברמה העובדתית, כל עוד המשימה נשארת בתחום הניתוח הלוגי.

מתאים ל

  • פתרון בעיות היגיון ומתמטיקה

    מציג ציון של מעל 55 במבחן GSM8K, מה שמאפשר לו להתמודד יפה עם חישובים ולוגיקה פשוטה יחסית לגודלו.

  • מענה על שאלות מבוססות עובדות

    תוצאה של 64.63 ב־TruthfulQA מצביעה על פחות נטייה להמציא תשובות בהשוואה למודלי בסיס דומים.

  • עיבוד טקסטים באנגלית בחומרה מקומית

    עובד במבנה ChatML ומתאים להרצה על כרטיס מסך בודד עם 24 גיגה זיכרון בלי תלות ברשת.

איפה זה נופל

האימון התמקד בצורה אגרסיבית בהשגת ציונים גבוהים בלוח המבחנים של Hugging Face, מה שמעלה חשש להתאמת יתר למבחנים הספציפיים האלה על חשבון גמישות אמיתית בשיחה. אין בכרטיס שום תיעוד על נתוני האימון המדויקים, המאמר המדעי על שיטת UNA עדיין לא פורסם, ואין שום מידע על בדיקות בטיחות או סינון פלטים פוגעניים. בנוסף, אין שום אזכור לתמיכה בשפות שאינן אנגלית, ולכן קשה להסתמך עליו במשימות עיבוד טקסט בעברית בלי לבדוק אותו מראש על נתונים אמיתיים.

שאלות
נפוצות

איזה מבנה פרומפט צריך לשלוח אליו?

היוצר מציין שהמודל עובד טוב כמעט עם כל ניסוח, אבל מגיב הכי טוב למבנה של ChatML או לפרומפט בסגנון Alpaca. הכרטיס מציג דוגמאות מפורטות לשני המבנים כולל תגיות התחלה וסיום.

האם הוא מבין עברית?

כרטיס המודל לא מציין שום מידע על תמיכה בשפות נוספות מעבר לאנגלית, וכל המבחנים שפורסמו נערכו באנגלית בלבד. אם יש לכם צורך בעברית, סביר להניח שהתוצאות יהיו ברמה הבסיסית של מיסטרל ללא התאמות מיוחדות.

איך מריצים

המשקל הכולל של הקבצים עומד על 13.5 גיגה בייט בדיוק bfloat16, כך שצריך כרטיס מסך עם לפחות 16 עד 24 גיגה זיכרון כדי להריץ אותו בצורה נקייה עם ספריות transformers ופייטורץ'. אם רוצים לחסוך משאבים, אפשר להשתמש בטוען Exllamav2_HF בקוונטיזציה של שמונה ביטים, שבה המפתח ממליץ להגדיר אלפא של 2.5 עבור הקשר של 16 אלף טוקנים.

אם אין לכם כרטיס מתאים מקומית, עדיף להרים שרת ייעודי בענן לפי שעה או להשתמש במודל גדול יותר דרך שירות חיצוני, בעיקר אם אתם צריכים תפוקה גבוהה בלי להתעסק בתחזוקת תשתית.

from transformers import pipeline

pipe = pipeline("text-generation", model="fblgit/una-cybertron-7b-v2-bf16")
print(pipe("שלום"))

הרישיון

הפרויקט מופץ תחת רישיון אפאצ'י 2.0. הרישיון הזה מתיר שימוש מסחרי חופשי, שינוי של הקוד והמשקולות, והפצה מחדש בתוך מוצרים סגורים. הדרישה העיקרית היא הכללת עותק של הרישיון המקורי ומתן קרדיט ליוצרים, יחד עם ציון השינויים שבוצעו אם נעשו כאלה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗