GPT
L

Llama-2-7b-chat-hf-function-calling-v2

קוד פתוח

Trelisרישיון לא דווח2023-08-22

  • transformers
  • safetensors
  • gguf
  • llama
  • text-generation

התאמה של מודל פתוח קומפקטי שמחזירה קריאות לפונקציות בפורמט JSON נקי. מתאים למי שרוצה להריץ סוכן אוטומטי מקומית בלי לשלם על מנוי מסחרי.

  • 6.7Bפרמטרים
  • 4,096טוקנים בהקשר
  • 16.4 GBמשקל הקבצים
  • 2,906הורדות בחודש

מה זה

מדובר בגרסת צ'אט של לאמה 2 שעברה אימון נוסף כדי לזהות מתי להפעיל פונקציה ולחלץ עבורה את המשתנים הדרושים. במקום טקסט חופשי, הפלט שלו מגיע כאובייקט JSON מסודר עם שם הפונקציה והארגומנטים שלה. בגרסה השנייה הזו, תיאורי הפונקציות יושבים מחוץ להנחיית המערכת כדי למנוע התנגשויות התנהגותיות שנצרבו במודל הבסיס.

היוצרים מדווחים על מדד שגיאה של בערך 0.5 באימון לגרסת 7B, לעומת 0.4 בגרסת 13B ו־0.3 ב־70B. המספר הזה לא מייצג דיוק בעולם האמיתי, אבל הוא מראה בבירור שבגודל הזה המודל מפספס הרבה יותר מאחיו הגדולים. בהשוואה למודל הבסיס הוא יודע לנתב פקודות לקוד חיצוני, אך היכולת הזו עובדת באמינות סבירה רק בהגדרות פשוטות יחסית.

מתאים ל

  • הפעלת כלים פשוטים

    מתאים לניתוב פקודות בסיסיות כמו חיפוש ברשת, מחיקת קובץ מקומי או שמירת שיחה.

  • סוכן מקומי ללא רשת

    אידיאלי לבדיקת תהליכי אוטומציה מבוססי פונקציות שרצים על המחשב בלי לשלוח מידע החוצה.

  • חילוץ משתנים מוגדרים

    עובד סביר כדי לשלוף מספרים, שמות ומחרוזות מתוך טקסט קצר ישירות למבנה JSON.

איפה זה נופל

המודל הזה אומן על פונקציות עם 0 עד 3 ארגומנטים בלבד, ומסתבך ברגע שמבקשים ממנו להתמודד עם מבנים מורכבים יותר. הכרטיס עצמו מדגיש שחובה לבצע עיבוד נוסף בצד השרת כדי לבדוק אם המשתמש בכלל סיפק את כל המידע הנדרש. בנוסף, המודל נוטה להחזיר טקסט רגיל מעורבב עם ה־JSON, או לפספס לחלוטין את מבנה הנתונים אם תיאור הפונקציה לא מוגדר בצורה מדויקת ופשוטה.

אותה משפחה

Llama-2-7b-chat-hf-function-calling יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ אותו ישירות בעברית?

המודל אומן והוגדר לעבודה באנגלית בלבד. אם תשלחו לו פקודות או תיאורי פונקציות בעברית, הסיכוי לחילוץ ארגומנטים שגוי או לקריסה במבנה ה־JSON עולה משמעותית.

כמה פונקציות אפשר להעביר לו בבקשה אחת?

הכרטיס מציג דוגמאות בודדות של פונקציה אחת או שתיים. בגלל גודל המודל וחלון ההקשר המוגבל ל־4,096 טוקנים, העמסה של עשרות פונקציות תגרום לו לבלבול בבחירת הכלי המתאים ולחריגה מהמגבלות.

איך מריצים

המשקל של הקבצים מגיע ל־16.4 גיגה-בייט בדיוק float16. כדי להעלות אותו לכרטיס מסך בפורמט המקורי צריך לפחות 16 גיגה זיכרון וידאו, מה שאומר כרטיס שרת ייעודי או קוונטיזציה של קובץ GGUF אם רוצים לעבוד מקומית על מחשב נייד. אפשר להריץ אותו גם דרך TGI של האגינג פייס או לשכור מכונה ב־RunPod.

אם המוצר שלכם צריך לטפל בנפח גבוה של בקשות משתמשים עם חילוץ נתונים מורכב, כנראה שפנייה ל־API חיצוני תעלה פחות מזמן התחזוקה של התשתית הזו. הוא משתלם בעיקר לבדיקות מקומיות, עבודה פנימית מאובטחת או מערכות שחייבות לרוץ באופליין מוחלט.

ollama run hf.co/Trelis/Llama-2-7b-chat-hf-function-calling-v2:ggml-vocab-llama

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

במקור מודל הבסיס כפוף לרישיון הקהילתי של מטא, שמאפשר שימוש מסחרי ומחקרי באנגלית תחת מגבלות מסוימות. בעמוד הנוכחי לא דווח רישיון רשמי ומוגדר מטעם Trelis, אף שהם מציינים שהמשקלים האלה ניתנים בחינם בניגוד לגרסאות האחרות שלהם. המשמעות היא שילוב שלו במוצר מסחרי חושף אתכם לאי-ודאות משפטית לגבי תנאי השימוש בנתוני האימון.

הרישיון המלא בעמוד המודל ↗