GPT
L

llama-3-firefunction-v2

קוד פתוח

fireworks-aillama32024-06-05

  • transformers
  • safetensors
  • llama
  • text-generation
  • function-calling

גרסת 70B של מטא שעברה כוונון ממוקד לקריאות פונקציה מקביליות וחילוץ מידע. תקבלו ביצועים שמתקרבים למודלים קנייניים בלי לצאת מתשתית פתוחה.

  • 71Bפרמטרים
  • 8,192טוקנים בהקשר
  • 131 GBמשקל הקבצים
  • 78הורדות בחודש

מה זה

מדובר בהתאמה ייעודית של Llama 3 בגודל 71B, שמטרתה לפתור בעיה מעצבנת, מודלים פתוחים נוטים לפספס כשמבקשים מהם להפעיל כלים חיצוניים במבנה מוגדר. כאן הכניסו תמיכה מלאה בהפעלת פונקציות בודדות או במקביל, יחד עם שיחה רגילה באותו רצף, ויכולת להחזיק עד עשרים הגדרות של פונקציות בו זמנית.

במבחני gorilla לפונקציות מקבילות הוא מציג ציון של 0.9 לעומת 0 מוחלט בגרסה הראשונה שלו, ועוקף במדד הזה את המודל המקורי של מטא ואפילו את GPT-4o שמקבל שם 0.89. מצד שני, במבחן השיחה הכללי של MT bench הוא ירד לציון 0.84 בהשוואה ל־0.89 של מודל הבסיס, כך שהדיוק המבני גובה מחיר מסוים באיכות התשובות הפתוחות.

מתאים ל

  • סוכני שיחה עם גישה לכלים

    ניהול שיחה חופשית תוך הפעלה של כמה קריאות שרת במקביל להבאת נתונים.

  • חילוץ מידע מובנה למסדי נתונים

    תרגום טקסט חופשי למבנה JSON מוגדר מראש לפי סכמה של עד 20 שדות ופונקציות.

  • אוטומציה של צינורות עבודה

    החלטה על ניתוב משימות והפעלת פקודות מערכת עצמאיות על בסיס הוראות המשתמש.

איפה זה נופל

הוא מוגבל לחלון הקשר קצר של 8,192 טוקנים, מה שמשאיר מעט מאוד מרווח כשדוחפים עשרים הגדרות סכמה מורכבות יחד עם היסטוריית שיחה. המפתחים מבהירים במפורש שהוא לא מותאם לקריאות פונקציה מקוננות ולא בנוי להתמודד עם מעל מאה הגדרות בו זמנית. בנוסף, במבחן nexus לפעולות מקביליות הוא הגיע לציון של 0.53 בלבד, כך שסכמות סבוכות במיוחד עדיין יכשילו אותו.

שאלות
נפוצות

האם הוא מסוגל לקרוא לכמה פונקציות בבת אחת?

כן, זה השינוי המרכזי מול הגרסה הקודמת שלא תמכה בזה כלל. הוא מסוגל לזהות צורך בכמה פעולות ולהחזיר קריאות מקביליות במענה בודד, עד תקרה של עשרים הגדרות שונות.

האם הוא מתאים לשיחה כללית במקום מודל הבסיס?

לא הייתי בוחר בו כצ'אטבוט כללי. הכוונון הייעודי פגע קלות ביכולות הניסוח וההיגיון הכללי שלו בהשוואה לגרסת ברירת המחדל של Llama 3, ולכן שווה לקחת אותו רק אם המערכת שלכם נשענת על הפעלת כלים.

איך מריצים

כדי להריץ 131 גיגה-בייט של משקולות float16 על שרת משלכם, תצטרכו לפחות שני כרטיסי A100 או H100 של 80GB, או לחלופין לכווץ אותו לקוונטיזציה של 4 ביט שתדרוש כרטיס בודד של 48GB. זה מערך יקר וכבד לתחזוקה שוטפת.

אם אתם לא חייבים את המידע מאחורי חומת אש קפדנית, כנראה שעדיף לשלוח בקשות לנקודת קצה מנוהלת דרך שירותים שמארחים אותו, במיוחד כשרוצים לבדוק התכנות לפני שמתחייבים לחומרה כבדה.

from transformers import pipeline

pipe = pipeline("text-generation", model="fireworks-ai/llama-3-firefunction-v2")
print(pipe("שלום"))

הרישיון

הרישיון הוא רישיון הקהילה של llama3. מותר להשתמש בו לצרכים מסחריים כל עוד המוצר שלכם לא חוצה רף של שבע מאות מיליון משתמשים פעילים בחודש, שאז צריך אישור ישיר ממטא, ומחייב לכלול את תנאי הרישיון המקוריים בכל הפצה.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗