GPT
O

octo-net-gguf

קוד פתוח

NexaAIcc-by-nc-4.02024-05-05

  • gguf
  • function calling
  • on-device language model
  • llama cpp
  • en

גרסת GGUF של מודל ניתוב שמיועד לבחור פונקציות ולחלץ להן פרמטרים. אם אתם בונים מערכת סוכנים מקומית וצריכים החלטות מהירות בקבצים קטנים, זה הכיוון.

  • 53.0 GBמשקל הקבצים
  • 2,141הורדות בחודש
  • 41לייקים

מה זה

המאגר הזה מציג המרות מכווצות של Octopus V4, מודל שמגדיר את עצמו כנתב של מודלי שפה. במקום לנהל שיחה חופשית וארוכה, התפקיד שלו הוא לקבל פקודה ממשתמש, להבין לאיזו פונקציה היא שייכת, ולייצר את הקריאה המתאימה יחד עם הארגומנטים הדרושים.

במקום מודל ענק וכבד שמנסה לפתור הכל, הרעיון כאן הוא להחזיק רכיב קל שמפנה משימות למודלים מתמחים או לכלים חיצוניים. הבדיקות שצורפו נשענות על שאלות ממאגר MMLU ונמדדו בעזרת llm-benchmark של Ollama, כשהקצב נע בין 27 טוקנים לשנייה בקבצים הלא מכווצים ועד כמעט 70 טוקנים לשנייה בגרסאות ה־4 ביט.

מתאים ל

  • ניתוב שאילתות לסוכנים

    קבלת פקודת משתמש וקריאה לפונקציה הייעודית המתאימה בזכות מהירות תגובה גבוהה ומשקל נמוך.

  • חילוץ פרמטרים מקומי

    פירוק בקשה קצרה לקריאת פונקציה מסודרת בלי להוציא מידע לרשת או להסתמך על שירותי ענן יקרים.

  • בדיקת ארכיטקטורות סוכנים

    הקמת סביבת פיתוח מקומית לבדיקת גרף של מודלי שפה על מחשב נייד רגיל בלי צורך בחומרה כבדה.

איפה זה נופל

המודל הזה לא נועד לשיחות כלליות, לכתיבת טקסטים או לסיכומים. חלון ההקשר בהגדרות הרשמיות עומד על 1024 טוקנים בלבד, כך שאי אפשר להעביר לו מסמכים שלמים או היסטוריה ארוכה, אלא רק שאילתות קצרות שמכוונות ישירות להפעלת פונקציה.

בנוסף, הכרטיס מציין רשמית שפה אנגלית בלבד. מי שבונה מוצר שדורש קלט בעברית צריך לבדוק היטב אם המודל מסוגל לחלץ פרמטרים מתוך טקסט עברי, או לתרגם את השאילתה מראש לפני שהיא מגיעה לנתב.

אותה משפחה

octo-net יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

איזו גרסת קובץ הכי כדאי להוריד מתוך המאגר?

עדיף להוריד את Q4_0 שנותנת איזון טוב של 65 טוקנים לשנייה וגודל של 2.18 ג'יגה בייט, או את Q5_K_M. המפתחים מזהירים במפורש שגרסאות של 2 ו־3 ביט גורמות לאיבוד איכות כבד, ובגרסת Q4_K_M יש איבוד יכולות בחלק מהפונקציות.

האם אפשר למשוך את המודל ישירות בפקודת ollama run?

לא. המודל לא הועלה למאגר הרשמי של Ollama. צריך להוריד את קובץ ה־GGUF ידנית מהעמוד, לכתוב Modelfile קצר עם הפניה לקובץ, ולהריץ פקודת יצירה מקומית לפני שאפשר להשתמש בו.

האם המודל יודע לענות על שאלות כלליות בצ'אט?

לא, הוא מתוכנן לשמש כנתב שמוציא קריאות לפונקציות עם ארגומנטים ולא כמודל שיחה. אם תשאלו אותו שאלות ידע כלליות הוא ינסה לחפש פונקציה מתאימה להפעיל במקום לנהל שיחה רגילה.

איך מריצים

מריצים אותו מקומית בעזרת llama.cpp שנבנה מראש, או על ידי יבוא ידני לקובץ Modelfile בתוך Ollama עם context באורך 1024 וטמפרטורה אפס. רוב קובצי ה־GGUF שוקלים בין 2.18 ל־2.82 ג'יגה בייט, כך שכל מעבד מודרני או כרטיס מסך בסיסי עם 4 עד 6 ג'יגה זיכרון מריץ אותם בלי בעיה ובמהירות של מעל 50 טוקנים לשנייה.

המפתחים ממליצים במיוחד על גרסאות כמו Q4_0, שמספקת סביב 65.7 טוקנים לשנייה, או Q5_K_M לאיכות מעט טובה יותר. לעומת זאת, לגרסאות 2 ביט ו־3 ביט לא כדאי להתקרב בגלל איבוד איכות משמעותי, וגרסת Q4_K_M סובלת מאיבוד יכולות בפונקציות מסוימות לפי דיווח היוצרים.

ollama run hf.co/NexaAI/octo-net-gguf:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא cc-by-nc-4.0. המשמעות פשוטה: השימוש מוגבל למחקר, ניסויים ופרויקטים אישיים בלבד. אם אתם רוצים לשלב את הקבצים האלה בתוך מוצר מסחרי, שירות בתשלום או כלי עסקי בחברה, הרישיון הזה אוסר זאת במפורש.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗