GPT
L

Llama-3-Groq-8B-Tool-Use

קוד פתוח

Groqllama32024-06-24

  • transformers
  • safetensors
  • llama
  • text-generation
  • facebook

יש כאן גם סקירה על Groq עצמו.

גרסה מכווננת של לאמה שמיועדת כולה להפעלת כלים וקריאות לפונקציות. היא מציגה דיוק של מעל 89 אחוזים במבחני הפעלת פונקציות ומביאה ביצועים מעולים למשקל של שמונה מיליארד פרמטרים.

  • 8Bפרמטרים
  • 8,192טוקנים בהקשר
  • 15.0 GBמשקל הקבצים
  • 416הורדות בחודש

מה זה

גרוק לקחו את לאמה 3 בגודל שמונה מיליארד פרמטרים והעבירו אותו כיוונון מלא עם אופטימיזציית העדפות ישירה במטרה אחת, להפוך אותו למודל שמפעיל כלים חיצוניים בלי לפספס. במבחן BFCL הוא הגיע לציון של 89.06 אחוזים בדיוק הכולל. המספר הזה שם אותו בראש הטבלה מול כל מודל קוד פתוח אחר בגודל הזה, מה שאומר שבמקום לקבל טקסט חופשי שמנסה לנחש מבנה של קוד, מקבלים ארגומנטים מדויקים לפונקציות.

הוא מיועד ספציפית למפתחים שבונים סוכנים, חיבורים ל־API ומניפולציות על מידע מובנה. במקום לזרוק פרומפטים מורכבים ולקוות שהמודל יחזיר ג'ייסון תקין, הוא מאומן להבין איזה כלי להפעיל ואיך להעביר אליו את המשתנים הנכונים.

מתאים ל

  • סוכן חכם לקריאות API

    הוא מנתח את בקשת המשתמש ובוחר במדויק מתי להפעיל שירות חיצוני ועם אילו פרמטרים.

  • חילוץ מידע מובנה

    הוא ממיר טקסט חופשי למבני נתונים תקינים עבור פונקציות המשך במוצר שלכם.

  • אוטומציה של צינורות עבודה

    הוא מנווט בין מספר כלים שונים ברצף לפי תוצאות שחוזרות ממערכות פנימיות.

איפה זה נופל

זה לא מודל לצ'אט כללי או לכתיבת תוכן. ברגע שתוציאו אותו מהמגרש של קריאות לפונקציות, הידע הכללי שלו נפגע ביחס למודל הבסיס, והוא עלול לייצר טעויות או תוכן מוטה. בנוסף, הוא רגיש מאוד להגדרות הדגימה. מי ששוכח לקבע טמפרטורה סביב 0.5 ו־top_p על 0.65 יקבל תוצאות לא יציבות. עברית בכלל לא מופיעה ברשימת השפות הנתמכות, כך שהסתמכות עליו לשיחות מקומיות תהיה הימור רע.

שאלות
נפוצות

האם המודל מתאים לפיתוח בוט שיחה רגיל בעברית?

לא. המודל אומן ותועד באנגלית בלבד, וכל המבנה שלו הותאם לקריאות מערכת ולא לשיחה טבעית. בשביל מענה שירותי או כתיבת תוכן בעברית עדיף לקחת מודל בסיס רחב יותר.

איך כדאי להגדיר את הפרמטרים של הריצה כדי לא לקבל שגיאות?

המפתחים מציינים במפורש להתחיל מטמפרטורה של 0.5 ו־top_p של 0.65. אם תעבדו עם ערכי ברירת מחדל גבוהים של מודלי שיחה רגילים, קריאות הפונקציה ישתבשו.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־15 גיגהבייט בדיוק של bfloat16, כך שתצטרכו כרטיס מסך עם לפחות 16 גיגה זיכרון כדי להחזיק אותו בזיכרון, ועדיף 24 גיגהבייט כדי להשאיר מקום לחלון הקשר של 8,192 טוקנים. הוא רץ ישירות דרך ספריית transformers בסביבת פייתון רגילה.

אם אין לכם שרת ייעודי עם כרטיס מתאים או שאתם לא רוצים לשלם על תשתית שרצה כל הזמן, אפשר לגשת אליו דרך ה־API של גרוק. ברוב המקרים, להרים מופע ענן פרטי בשביל שמונה מיליארד פרמטרים יהיה יקר ומיותר ביחס לקריאת רשת מהירה.

from transformers import pipeline

pipe = pipeline("text-generation", model="Groq/Llama-3-Groq-8B-Tool-Use")
print(pipe("שלום"))

הרישיון

הרישיון הוא רישיון הקהילה של מטא ללאמה 3. הוא מתיר שימוש מסחרי ומחקרי חופשי לרוב החברות, כל עוד מספר המשתמשים הפעילים בחודש לא חוצה את רף מאות המיליונים שהוגדר במקור. אם אתם מוציאים מוצר שמבוסס עליו, חובה לכלול את תנאי הרישיון המקוריים ולשמור על שם המודל לפי הדרישות של מטא.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗