GPT
A

Athene-V2-Agent

קוד פתוח

Nexusflowother2024-11-12

  • transformers
  • safetensors
  • qwen2
  • text-generation
  • RLHF

מודל פתוח מבוסס קוון שתוכנן ספציפית להפעלת כלים וסוכנים מורכבים. הוא מתאים למי שרוצה תחליף מקומי ומדויק ל־GPT-4o במערכות שמבצעות קריאות לפונקציות ברצף.

  • 73Bפרמטרים
  • 32,768טוקנים בהקשר
  • 135 GBמשקל הקבצים
  • 83הורדות בחודש

מה זה

מדובר בכיוונון של Qwen-2.5-72B-Instruct שמיועד כמעט לחלוטין לקריאה לפונקציות ולתכנון מסלולי פעולה. המפתחים שלו מדווחים שהוא עוקף את GPT-4o ב־18 אחוז בהצלחה של קריאה בודדת לפונקציה, וב־17 אחוז במשימות סוכניות מרובות שלבים, למרות שהבדיקות נערכו על כלים ומצבים שהוא לא ראה באימון.

הייחוד שלו הוא בשליטה הנוקשה. הוא לא מחזיר טקסט חופשי אלא חושב, מתכנן ומוציא פקודות ביצוע. אפילו שיחה פשוטה עם המשתמש או דחיית בקשה לא רלוונטית דורשות להגדיר לו כלי ייעודי כמו פונקציית צ'אט, אחרת הוא ינסה בכוח לקרוא לאחת הפונקציות הקיימות כדי לענות.

מתאים ל

  • סוכן חילוץ מידע ו־RAG

    חיפוש מידע ברשת או במאגרים עם כלי ייעודי, תוך תכנון שלבי השאילתות עד להשגת התשובה.

  • אוטומציה של שרשראות API

    ביצוע תהליכים מורכבים הדורשים הפעלת פונקציות מרובות עם תלויות פנימיות עמוקות.

  • תחליף מקומי ל־GPT-4o FC

    מערכות ארגוניות הדורשות תאימות ל־OpenAI Tool Use אך מחייבות הרצה עצמית על חומרה פנימית.

איפה זה נופל

הוא לא מודל שיחה רגיל ויסרב לפטפט אם לא תגדירו לו כלי שיחה מפורש. אם משתמש ישאל שאלה לא קשורה, הוא ינסה להפעיל עליה פונקציה בכוח אלא אם הוספתם כלי מיוחד לטיפול בבקשות ריקות. בנוסף, הוא תומך רשמית באנגלית בלבד ודורש דוקסטרינגס מפורטים ומדויקים מאוד לכל פונקציה כדי לא לפספס.

שאלות
נפוצות

אפשר להשתמש בו ישירות בספריית transformers הרגילה?

טכנית כן, אבל המפתחים מזהירים מפורשות ששימוש בתבנית הרגילה ייתן תוצאות גרועות. המודל מחייב שימוש בתמונת הדוקר שלהם שכוללת פרסר מיוחד לחילוץ פקודות מתוך שלב התכנון.

האם הוא מתאים ליישומי שירות לקוחות בעברית?

לא. המודל מוגדר רשמית לאנגלית בלבד, וסגנון התגובה שלו מבוסס כולו על הפעלת פונקציות ולא על ניהול שיחה טבעית, אלא אם מגדירים לו כלי שיחה באנגלית.

איך מריצים

כדי להריץ 73 מיליארד פרמטרים במשקל 135 ג'יגה בייט ב־bfloat16, המפתחים מספקים תמונת דוקר מותאמת של vLLM שמיועדת למערך של 8 מאיצי GPU עם חלוקת טנסורים. הקוד והפרסר של הקריאות מובנים בתוך התמונה הזו, והם מזהירים ששימוש בתבנית השיחה הרגילה של HuggingFace יפגע בביצועים.

אם אין לכם שרת ייעודי חזק מאוד בענן או במשרד, העלויות של החומרה הזו יהפכו את ההרצה העצמית ללא כדאית לעומת קריאה ל־API של מודל מסחרי מוכן. בנוסף, חובה לקבע דגימה כבויה וטמפרטורה על אפס לקבלת תוצאות יציבות.

from transformers import pipeline

pipe = pipeline("text-generation", model="Nexusflow/Athene-V2-Agent")
print(pipe("שלום"))

הקבצים

48 קבצים במאגר, 135 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הוא מופץ תחת רישיון מחקר ייעודי של Nexusflow ולא תחת רישיון קוד פתוח סטנדרטי. המשמעות היא שאי אפשר לשלב אותו במוצר מסחרי בלי לבדוק ישירות מול החברה את תנאי השימוש המדויקים המופיעים במסמך שלהם.

הרישיון המלא בעמוד המודל ↗