GPT
E

Einstein-v6.1-Llama3-8B

קוד פתוח

Weyaxiother2024-04-19

  • transformers
  • safetensors
  • llama
  • text-generation
  • axolotl

גרסת כוונון מלא לבסיס של Llama 3 8B, שנועדה לחזק יכולות חשיבה כלליות ופיזיקה. היא מתאימה למי שמחפש משקל קל יחסית שמגיב בתבנית ChatML מוכרת.

  • 8Bפרמטרים
  • 8,192טוקנים בהקשר
  • 16.3 GBמשקל הקבצים
  • 8,467הורדות בחודש

מה זה

המודל מבוסס על Meta Llama 3 8B ועבר אימון מלא, Full Fine-Tune, במשך שני אפוקים ו־2,026 צעדים בעזרת ספריית axolotl על חומרת שמונה כרטיסי RTX 3090 וכרטיס RTX A6000 בודד. המטרה כאן הייתה לקחת את מודל הבסיס ולכוונן אותו על מגוון מאגרי נתונים שעברו סינון, תוך שימוש במבנה שיחה סטנדרטי של ChatML שנתמך ישירות דרך הכלים של transformers.

במבחני הביצועים של Open LLM Leaderboard הראשון הוא מציג ממוצע של 68.60, עם ציון של 82.41 ב־HellaSwag ו־66.11 ב־GSM8k, מה שמראה יכולת סבירה למדי בלוגיקה ובמתמטיקה בסיסית ביחס לגודל שלו. מנגד, בלוח המבחנים המחמיר יותר, גרסה 2, הממוצע צונח ל־19.99 עם 5.74 בלבד ב־MATH ברמה 5 ו־4.25 ב־GPQA. המשמעות ברורה, הוא מתמודד יפה עם בעיות היגיון שגרתיות ברמת בית ספר, אבל מתקשה ברגע שהשאלות דורשות העמקה אקדמית אמיתית.

מתאים ל

  • עוזר שיחה מקומי באנגלית

    מתאים לבוטים פנימיים בזכות התמיכה המובנית בתבנית ChatML ודרישות זיכרון שמתאימות לכרטיס בודד.

  • פתרון בעיות היגיון קלות

    מספק תוצאה יפה של 66.11 במבחן GSM8k, שמספיקה למשימות חישוב בסיסיות וניסוח תשובות מובנות.

  • מודל בסיס למיזוגים

    היכולות שלו כבר שימשו פרויקטים אחרים כמו Octopus-V4-3B לצורך למידה וחיזוק יכולות ספציפיות.

איפה זה נופל

הנתונים הרשמיים מראים חולשה מובהקת במשימות חישוב מתקדמות. תוצאה של 5.74 ב־MATH ו־4.25 ב־GPQA אומרת שאי אפשר לסמוך עליו בפתרון בעיות מדעיות מורכבות ללא בדיקה אנושית צמודה. בנוסף, המודל אומן והוגדר עבור השפה האנגלית בלבד, כך שלא כדאי לבנות עליו לפרויקטים שדורשים עברית טבעית או תרגום מדויק מבלי לבצע התאמות נוספות.

שאלות
נפוצות

האם אפשר להשתמש בו ישירות מול משתמשי קצה בעברית?

המודל הוגדר ואומן באנגלית בלבד. פנייה אליו בעברית צפויה להניב תוצאות שבורות, חוסר עקביות בתחביר והזיות, ולכן לא הייתי משלב אותו במוצר ישראלי בלי שכבת תרגום או כוונון ייעודי.

איזו גרסה כדאי להוריד כדי לבדוק אותו במחשב אישי?

אם אין לכם כרטיס מסך ייעודי של 24 גיגה בייט, הגרסה המקורית של 16.3 גיגה בייט תכביד עליכם. עדיף להוריד את גרסת ה־GGUF שהוכנה על ידי bartowski, שרצה בקלות על זיכרון המחשב דרך כלים כמו llama.cpp.

איך מריצים

המשקל המקורי מגיע בקבצי bfloat16 שתופסים 16.3 גיגה בייט. כדי להריץ אותו בצורה נקייה בלי קוונטיזציה תצטרכו כרטיס מסך עם לפחות 24 גיגה בייט של זיכרון וידאו, כמו RTX 3090 או A5000, במיוחד אם אתם מתכננים לנצל את מלוא חלון ההקשר של 8,192 הטוקנים.

אם החומרה שלכם צנועה יותר, יש למודל גרסאות מכווצות בפורמטים כמו GGUF, ExLlamaV2 ו־AWQ שהוכנו על ידי הקהילה. גרסת GGUF תאפשר לכם להריץ אותו ישירות על מעבד ומעט זיכרון ראם במחשב מקומי, מה שהופך את ההרצה העצמאית לנגישה בלי לשלם על שרתי ענן או ספקי צד שלישי.

from transformers import pipeline

pipe = pipeline("text-generation", model="Weyaxi/Einstein-v6.1-Llama3-8B")
print(pipe("שלום"))

הרישיון

הרישיון מוגדר בתור other, כלומר רישיון מותאם אישית שאינו קוד פתוח סטנדרטי. היות שמדובר בכוונון של Llama 3, חלים עליו תנאי השימוש וההגבלות של מטא, מה שמחייב אתכם לבדוק היטב את תנאי הרישיון המקוריים לפני שאתם משלבים אותו במוצר מסחרי.

הרישיון המלא בעמוד המודל ↗