GPT
G

Gemma-2-llamacpp

רץ בדפדפן

gokaygokayapache-2.02024-07-04

  • gradio

ממשק שיחה פשוט לבדיקת מודלי Gemma 2 בגדלים שונים ישירות בדפדפן. מתאים למי שרוצה להתנסות בהסקה מבוססת llama.cpp בלי להוריד משקלים כבדים למחשב.

  • הורדות בחודש
  • 142לייקים

מה זה

אתם מקלידים הודעת טקסט בחלון צ'אט ומקבלים תשובה מאחד ממודלי Gemma 2 שגוגל שחררה. הממשק מבוסס על llama.cpp וטוען קובצי GGUF מכווצים של bartowski או גרסאות רשמיות, בגדלים של 2B, 9B ועד 27B.

ברירת המחדל עובדת עם המודל הקטן ביותר של שני מיליארד פרמטרים, אבל דרך תפריט הקלטים הנוספים אפשר לעבור לגדלים הכבדים יותר. מתחת למכסה יש גם שליטה בהנחיית המערכת, בטמפרטורה שמתחילה מ־0.7 ומגיעה עד 4.0, ובאורך התשובה המרבי שנע בין טוקן בודד ל־4096 טוקנים.

מתאים ל

  • השוואת גדלי מודלים

    מעבר מהיר בין גרסאות 2B, 9B ו־27B כדי לראות איך גודל המודל משפיע על איכות התשובה.

  • בדיקת פרומפטים

    בחינת ניסוחים עם שינויי טמפרטורה והנחיות מערכת שונות ישירות בממשק הצ'אט.

  • התנסות ב־llama.cpp

    הערכת ביצועי קובצי GGUF מכווצים בדפדפן בלי להגדיר סביבת ריצה מקומית.

איפה זה נופל

המעבר למודל 27B דורש משאבים משמעותיים, ועל חומרה שיתופית הוא עלול לפעול לאט יותר או להיעצר אם יש עומס. בנוסף, הממשק הוא צ'אט טקסט בלבד, כך שאי אפשר להעלות אליו קבצים, מסמכים או תמונות, ואין כאן אינטגרציה עם מקורות מידע חיצוניים.

שאלות
נפוצות

האם השימוש בממשק עולה כסף?

הגישה לממשק פתוחה בחינם בדפדפן דרך Hugging Face. אין צורך לשלם או להזין פרטי אשראי כדי לשוחח עם המודלים.

מה קורה עם הטקסט שאני כותב שם?

השיחות מעובדות על השרת שמריץ את הדמו בזמן אמת. הממשק אינו מציע שמירה בענן, אך לא מומלץ להקליד בו מידע רגיש.

האם אפשר להריץ את המערכת הזאת מקומית?

כן, הקוד מבוסס על ספריות פתוחות כמו llama.cpp ו־Gradio. אפשר להוריד את קובצי ה־GGUF של bartowski ולהריץ אותם על מחשב אישי בעל מפרט מתאים.

במה זה שונה משימוש רגיל ב־Gemma 2?

כאן מריצים גרסאות קוונטיזציה של המודל באמצעות מנוע llama.cpp ולא את המשקלים המקוריים המלאים. זה חוסך זיכרון ומאפשר ריצה קלה יותר, עם פגיעה מזערית באיכות.

איך משתמשים

נכנסים לדף, כותבים הודעה בתיבת הטקסט ולוחצים על שליחה. אם רוצים לשנות מודל ל־9B או 27B, או לכוונן את ה־Max tokens, פותחים את ההגדרות הנוספות לפני השליחה. התשתית רצה על חומרת Zero A10G שמקצה מעבד גרפי לפי דרישה, כך שייתכן עיכוב קצר של כמה שניות כשהמודל נטען לזיכרון לפני שהתשובה מתחילה לזרום.

הרישיון

הקוד מופץ תחת רישיון apache-2.0 שמאפשר שימוש חופשי, אך משקלי המודלים של Gemma כפופים לתנאי השימוש וההפצה המקוריים של גוגל.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗