GPT
Z

zephyr-orpo-141b-A35b-v0.1

קוד פתוח

HuggingFaceH4apache-2.02024-04-10

  • transformers
  • tensorboard
  • safetensors
  • mixtral
  • text-generation

גרסת ענק בקוד פתוח שמבוססת על Mixtral 8x22B ועברה כיוונון בהעדפות ללא שלב SFT מקדים. מתאים למי שחייב מודל שיחה חזק בשליטה מלאה על השרתים שלו.

  • 141Bפרמטרים
  • 65,536טוקנים בהקשר
  • 262 GBמשקל הקבצים
  • 181הורדות בחודש

מה זה

מדובר במודל מומחים שמחזיק 141 מיליארד פרמטרים בסך הכל, כשבכל ריצה מופעלים 39 מיליארד מתוכם. Hugging Face אימנו אותו על בסיס Mixtral 8x22B באמצעות שיטה בשם ORPO, שלוקחת נתוני העדפות ומבצעת התאמה ישירה תוך שעה ועשרים דקות בלבד על 32 כרטיסי H100, במקום לעבור קודם אימון הוראות רגיל.

במבחני ביצועים הוא עוקף את DBRX ואת Mixtral 8x7B ביכולת מעקב אחר הוראות מורכבות, עם ציון של 65.06 ב־IFEval. עם זאת, במבחן השיחה הכללי MT Bench הוא מקבל 8.17, ציון שנמצא מעט מתחת לשני המודלים האחרים, ובמבחן ההיגיון AGIEval הוא מפגר אחרי 8x7B הקטן יותר. המשמעות היא שהכוח העיקרי שלו נמצא בהיצמדות להנחיות טכניות מדויקות ולא בהכרח בחשיבה לוגית עמוקה.

מתאים ל

  • ביצוע פקודות מובנות באנגלית

    התוצאה הגבוהה ב־IFEval מראה שהוא עוקב בדייקנות אחרי פורמטים קשיחים ומגבלות אורך.

  • סביבות פיתוח מבודדות

    מתאים לחברות שמחזיקות שרתי GPU בארגון וחייבות מענה ללא שליחת מידע לספקי צד שלישי.

  • מחקר על שיטות יישור

    משמש דוגמה מעשית לבחינת ביצועי ORPO על מודל MoE ענק ללא אימון SFT מקדים.

איפה זה נופל

היוצרים מציינים במפורש שהמודל לא עבר שום התאמת בטיחות או סינון תוכן מהסוג שקיים במודלים מסחריים כמו ChatGPT. הוא נוטה לייצר פלטים בעייתיים אם מבקשים ממנו, ולכן אסור לחבר אותו ישירות למשתמשי קצה בלי שכבת בדיקה וסינון עצמאית שלכם.

בנוסף, האימון התמקד כמעט כולו באנגלית. אין נתונים על יכולות המודל בעברית, ובסיס הנתונים של מודל המקור אינו שקוף במלואו, כך שקשה לדעת אילו הטיות מסתתרות בתוכו.

שאלות
נפוצות

למה בשם המודל כתוב A35b ובתיאור רשום 39B?

היוצרים הסבירו שהייתה להם טעות חישוב קלה בשם המקורי שניתן למאגר. בפועל המודל מפעיל 39 מיליארד פרמטרים פעילים בכל שלב, ולא 35.

האם המודל יתאים לשירות לקוחות בעברית?

לא מומלץ לבנות עליו לזה. כרטיס המודל מציין אנגלית כשפה עיקרית, והוא אומן על סט נתונים סינתטי באנגלית בלבד ללא בדיקות לשפות אחרות.

איך מריצים

כדי להעלות 262 גיגה-בייט של משקלים בפורמט bfloat16 צריך אשכול שרתים רציני. אתם חייבים לפחות ארבעה כרטיסי A100 או H100 של 80GB רק כדי לטעון אותו לזיכרון לפני שבכלל שלחתם פרומפט אחד. הרצה מקומית על תחנת עבודה יחידה לא באה בחשבון בלי קוונטיזציה כבדה.

אם אין לכם קלאסטר GPU ייעודי שכבר פועל בחברה, להרים תשתית עצמאית בשביל הניסוי הזה יעלה אלפי דולרים בחודש בענן. במצב כזה עדיף לחפש ספק שמגיש את המודל דרך נקודת קצה ולשלם לפי טוקן, אלא אם פרטיות המידע מחייבת עבודה ברשת מבודדת לחלוטין.

from transformers import pipeline

pipe = pipeline("text-generation", model="HuggingFaceH4/zephyr-orpo-141b-A35b-v0.1")
print(pipe("שלום"))

הקבצים

83 קבצים במאגר, 262 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הקוד והמשקלים שוחררו תחת רישיון Apache 2.0. הרישיון מתיר שימוש מסחרי מלא, שינוי של המשקלים והפצה בתוך מוצרים, ללא תשלום תמלוגים. התנאי העיקרי הוא שמירה על הודעת זכויות היוצרים וציון השינויים שביצעתם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗