GPT
A

Athene-V2-Chat

קוד פתוח

Nexusflowother2024-11-12

  • transformers
  • safetensors
  • qwen2
  • text-generation
  • RLHF

אימון RLHF על גבי הבסיס של Qwen 2.5 הביא משקל פתוח שמציג ביצועים שמשתווים ל־GPT-4o במתמטיקה וקוד. אם אתם צריכים חלופה מקומית חזקה למודל סגור, זו אופציה בולטת.

  • 73Bפרמטרים
  • 32,768טוקנים בהקשר
  • 135 GBמשקל הקבצים
  • 3,387הורדות בחודש

מה זה

מדובר במודל שיחה שמבוסס על Qwen-2.5-72B-Instruct ועבר כוונון ייעודי בשיטת RLHF על ידי הצוות של Nexusflow. המטרה המרכזית שלו הייתה להגיע לקצה העליון של מודלי המשקל הפתוח, והמפתחים מדווחים שהוא עוקף את הגרסה המובילה של GPT-4o בקטגוריות מתמטיקה ושאלות קשות בלוח המובילים של Chatbot Arena, לצד ביצועים דומים בתכנות, מעקב אחר הוראות ושיחות מרובות שלבים.

בניגוד למודלי בסיס שדורשים הנדסת פרומפטים מורכבת כדי לעבוד כמו שצריך, הוא מגיע מכויל מראש לתבנית השיחה הרגילה של משפחת Qwen. המשמעות בשטח היא שאפשר לשלב אותו ישירות בצנרות קיימות בלי לשנות את מבנה ההודעות, תוך קבלת תשובות ממוקדות בבעיות היגיון וקוד מורכב כבר מההרצה הראשונה.

מתאים ל

  • פתרון בעיות מתמטיקה

    הוא מציג ביצועים גבוהים במיוחד בחישובים מורכבים שעוקפים מודלים מסחריים סגורים.

  • כתיבת קוד וסקריפטים

    התאמה טובה לפיתוח תוכנה ברמה שמקבילה ל־GPT-4o במעקב אחר דרישות הנדסיות.

  • סוכן שיחה מקומי לחברות

    מאפשר לשמור נתונים רגישים בשרת פרטי בלי לשלוח פניות לשירותי צד שלישי.

איפה זה נופל

הכרטיס מציין אנגלית בלבד, כך שאין שום ערובה לאיכות הפלט בעברית וכנראה שתקבלו תוצאות שבורות או איטיות בשפה המקומית. בנוסף, המפתחים מציינים שבשאלות מתמטיקה קשות או חידות היגיון קטנות הוא זקוק להוראת מערכת מפורשת שתדרוש ממנו לחשוב צעד אחר צעד כדי לא לטעות, מה שאומר שבברירת המחדל הוא עדיין מועד להזיות במשימות חישוב.

אותה משפחה

Athene יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בעבודה עם טקסטים ארוכים?

הוא מגיע עם חלון הקשר של 32,768 טוקנים. זה מספיק לשיחות עמוקות, בדיקת קבצי קוד שלמים ושאילתות מורכבות, אך לא מתאים לניתוח ספרים שלמים בהרצה אחת.

איך אפשר לשפר את התשובות שלו בחידות וחישובים?

המפתחים ממליצים להוסיף פרומפט מערכת שמנחה אותו לחשוב צעד אחר צעד. לפי הכרטיס, תוספת כזו משפרת משמעותית את הדיוק בבעיות לוגיות עדינות.

איך מריצים

כדי להעלות 73 מיליארד פרמטרים בדיוק המקורי של bfloat16 תצטרכו לפחות 150 גיגה בייט של זיכרון גרפי, כלומר שרת עם שני כרטיסי A100 או H100 של 80GB. אפשר לטעון אותו ישירות דרך ספריית transformers הרגילה עם חלוקה אוטומטית בין הכרטיסים.

אם אין לכם תשתית כזאת בענן או מקומית, אין טעם להסתבך עם הורדה של 135 גיגה בייט של קבצים, ועדיף להשתמש ב־API חיצוני או לפנות לגרסאות מכווצות אם הביצועים שלהן יספיקו לכם.

from transformers import pipeline

pipe = pipeline("text-generation", model="Nexusflow/Athene-V2-Chat")
print(pipe("שלום"))

הקבצים

45 קבצים במאגר, 135 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל מופץ תחת רישיון מחקר ייעודי בשם Nexusflow Research License שמסווג בנתונים כ־other. זה אומר שהוא אינו רישיון קוד פתוח סטנדרטי, ואתם מחויבים לקרוא את קובץ ה־PDF של תנאי השימוש כדי לבדוק הגבלות מסחריות לפני הטמעה במערכות ייצור.

הרישיון המלא בעמוד המודל ↗