GPT
A

AgentSearch-V1

קוד פתוח

SciPhiרישיון לא דווח2023-12-09

מאגר ענק של טקסטים מחולקים לפסקאות לצד וקטורים מוכנים של מודל jina. הוא מיועד למי שרוצה לבנות מערכות חיפוש וסוכנים בלי לשלם על חישוב וקטורים למיליארדי רשומות.

  • 774הורדות בחודש
  • 92לייקים

מה זה

המאגר כולל מעל חמישים מיליון מסמכים ומעל מיליארד פסקאות, כולן עברו עיבוד מקדים והצמדה של וקטורים. המידע נאסף ממקורות ציבוריים מוכרים ברשת, סונן ונוקה כדי להתאים לאימון מודלים ולחיפוש. בין המקורות תמצאו מאמרים מדעיים מתוך ArXiv, ערכים מוויקיפדיה, ספרים מפרויקט גוטנברג ומאגרים דומים, תוכן מתמטי מתוך OpenWebMath, שאלות ותשובות מתוך StackExchange, וטקסטים מסוננים מתוך RedPajama-Data-V2 שמתבססים על Creative Commons.

כל רשומה בנויה בפורמט קבוע שמכיל כתובת מקור, כותרת, מטא-דאטה מורחב שכולל תאריך ומקור, מערך של מקטעי טקסט, ושם תת-המאגר שממנו הגיע המידע. החלק הייחודי כאן הוא שדה הווקטורים שמכיל מערך בינארי של ערכי float32 בגודל 768 שנוצרו על ידי המודל jina-embeddings-v2-base-en, כך שאין צורך לחשב אותם מחדש.

מתאים ל

  • הקמת אינדקס חיפוש סמנטי

    טעינת הווקטורים המוכנים ישירות לתוך בסיס נתונים וקטורי בלי להוציא כסף וזמן על חישוב מקדים.

  • אחזור מידע לסוכני בינה

    חיבור המאגר למערכות RAG שמחפשות מידע עובדתי מהיר באנגלית מתוך ויקיפדיה ומאמרים מדעיים.

  • אימון מודלי אחזור ודירוג

    שימוש בזוגות של טקסטים ומזהי מקור כדי לבדוק ביצועי שליפה והערכת מנועי חיפוש.

איפה זה נופל

הנתונים כולם באנגלית בלבד ואין כאן עברית כלל. מעבר לזה, המאגר פורסם בסוף 2023 ומסתמך על גזירות נתונים היסטוריות, כך שמידע עדכני לא קיים פה. החיסרון המשמעותי ביותר הוא התלות המוחלטת במודל ההטמעה של jina. הווקטורים שמגיעים עם הדאטהסט מקובעים למרחב הוקטורי שלו. אם מערכת האחזור שלכם רצה על מודל אחר, כל הווקטורים המוכנים חסרי תועלת ותצטרכו לחשב אותם מאפס, מה שמבטל את היתרון המרכזי של החבילה.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

אין כאן רישיון כולל שמתיר שימוש כזה. המאגר מורכב משילוב של מקורות שונים, כולל ויקיפדיה וספרים, ולכל אחד מהם יש תנאים משלו. חובה לבדוק את הרישיון של כל תת-מאגר בנפרד לפני שמכניסים אותו לפרויקט מסחרי.

האם יש בדאטהסט תמיכה בעברית?

לא, המאגר מוגדר וכולל תוכן בשפה האנגלית בלבד. כל המקורות, מ־ArXiv ועד StackExchange, מכילים טקסטים באנגלית. למודלים שמיועדים לעברית המאגר הזה לא יתרום.

כמה מקום צריך בשביל לעבוד איתו?

מדובר במאות קובצי Parquet שמכסים מעל מיליארד רשומות יחד עם וקטורים צמודים, כך שהמשקל הכולל מגיע למאות ג'יגה-בייטים. הדרך הסבירה היחידה לעבוד איתו היא באמצעות הזרמה ישירה בלי להוריד את כל הקבצים מראש לדיסק.

מה היתרון של המאגר הזה על פני הורדה של ויקיפדיה או ArXiv לבד?

החיסכון בזמן עיבוד. המפתחים כבר חילקו את הטקסטים לפסקאות קצרות והריצו עליהם מודל הטמעה, כך שמקבלים מידע מסונן עם וקטורים מוכנים של jina בלי להחזיק שרתי GPU לצורך החישוב.

איך טוענים

טוענים את המידע ישירות דרך ספריית datasets באמצעות הפונקציה load_dataset עם המזהה של SciPhi. בגלל שמדובר במיליארדי רשומות שמפוזרות על פני 240 קובצי Parquet, חובה להפעיל הזרמה עם פרמטר streaming=True כדי לא לחנוק את הזיכרון והדיסק. אפשר לסנן מראש ולטעון רק תיקייה ספציפית לפי המקור, למשל arxiv. כדי להשתמש בנתונים בפועל, ממירים את שדה הווקטורים בעזרת numpy למערך דו-ממדי של 768 ממדים, ומפענחים את שדות הטקסט והמטא-דאטה שמגיעים כמחרוזות JSON.

from datasets import load_dataset

ds = load_dataset("SciPhi/AgentSearch-V1")

הרישיון

ליוצרי המאגר אין רישיון אחיד והם לא הגדירו רישיון ברמת המאגר ב־Hugging Face. במקום זה הם מפנים לרישיונות של כל מקור בנפרד, כולל Common Crawl, ויקיפדיה, ArXiv וספרים שחלקם מ־books3. המשמעות ברורה: אסור להניח שמותר להשתמש בזה למטרות מסחריות או לאמן מוצר מסחרי בלי לבדוק כל תת-מאגר בנפרד, ובפרט את מקורות הספרים שעלולים לכלול זכויות יוצרים מורכבות.

הרישיון המלא ב־Hugging Face ↗