GPT
T

text2cypher-2024v1

קוד פתוח

neo4japache-2.02024-08-30

  • neo4j
  • cypher
  • text2cypher

המאגר מרכז 44,387 שלשות של שאלה, סכמת בסיס נתונים ושאילתת Cypher תואמת. הוא נבנה כדי לאמן ולהעריך מודלים שממירים שפה טבעית לשאילתות גרף של Neo4j.

  • 227הורדות בחודש
  • 55לייקים

מה זה

הנתונים מגיעים מאוסף של מקורות ציבוריים שנוקו ואורגנו יחד. הם כוללים דאטהסטים סינתטיים שנוצרו באמצעות מודלים כמו GPT-4 Turbo, GPT-4o, Gemini ו־Claude Opus, לצד מאגרי מיקור המונים, נתוני הערכת RAG, דאטהסטים מגרסת 2023 ומאגרים ציבוריים נוספים מ־Hugging Face כמו Cy-Spider.

בסך הכל יש כאן 44,387 רשומות שמחולקות מראש לשני חלקים: 39,554 דוגמאות בסט האימון ו־4,833 דוגמאות בסט הבדיקה. כל רשומה כוללת מזהה רץ, שאלת משתמש באנגלית, סכמה של בסיס הנתונים, שאילתת Cypher מתאימה, מקור המידע וכינוי של בסיס הנתונים במידה והוא קיים.

מתאים ל

  • אימון מודלי Text-to-Cypher

    כוונון עדין של מודלי שפה ליצירת שאילתות גרף מדויקות על בסיס שאלת משתמש וסכמה.

  • הערכת ביצועי מודלים

    שימוש בסט הבדיקה המובנה שכולל 4,833 דוגמאות כדי למדוד דיוק של מודלים קיימים.

  • בניית ממשקי RAG לגרפים

    שילוב המודל המאומן במערכות RAG שצריכות לשלוף מידע מובנה מתוך בסיסי נתונים מסוג Neo4j.

איפה זה נופל

כל השאלות בדאטהסט מנוסחות באנגלית בלבד, כך שאם אתם בונים מוצר בעברית תצטרכו לתרגם או לייצר דוגמאות בעצמכם. חלק ניכר מהדוגמאות נוצר באופן סינתטי על ידי מודלי שפה מסחריים שונים, מה שעלול להכניס הטיות או דפוסי ניסוח קבועים שלא תמיד מייצגים שאלות של משתמשים אמיתיים. בנוסף, בחלק מהשורות חסר קישור למסד הנתונים הספציפי בשדה הייעודי, מה שמחייב בדיקה של תקינות השאילתות מול סכמות אמיתיות לפני העלאה לפרודקשן.

שאלות
נפוצות

האם יש בדאטהסט תמיכה בעברית?

לא, הנתונים מתועדים באנגלית בלבד. כל שאלות המשתמש והסכמות מנוסחות בשפה האנגלית, ולכן שימוש בעברית ידרוש תרגום מוקדם או הוספת נתונים מקומיים.

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, הרישיון המדווח הוא Apache 2.0 שמאפשר שימוש מסחרי חופשי. עליכם רק לשמור על תנאי הייחוס והודעת הרישיון המקורית כפי שנדרש.

איך נאספו הנתונים שבמאגר?

הנתונים מורכבים משילוב של מקורות ציבוריים קיימים ודוגמאות סינתטיות שנוצרו על ידי מודלים כמו GPT-4 ו־Claude. בנוסף שולבו בו דאטהסטים ממיקור המונים ומאגרי הערכה פנימיים של Neo4j שעברו ניקוי ואיחוד.

כמה דוגמאות יש ואיך הן מחולקות?

המאגר מכיל 44,387 דוגמאות בסך הכל המאוחסנות בקובצי Parquet. הוא מגיע מחולק מראש ל־39,554 רשומות אימון ו־4,833 רשומות בדיקה.

איך טוענים

הטעינה פשוטה כי הקבצים שמורים בפורמט Parquet סטנדרטי המחולק לקובץ train וקובץ test, ללא צורך באישור גישה מיוחד. השדות המרכזיים שמעניינים אתכם בזמן אימון הם question, schema ו־cypher שמכילים את הקלט והפלט של המודל. כדאי לשים לב לשדה data_source אם אתם רוצים לסנן מקורות ספציפיים, ולשגיאת כתיב ידועה שהמפרסמים ציינו בעמודה database_reference_alias שבה מופיע eoflix במקום neoflix.

from datasets import load_dataset

ds = load_dataset("neo4j/text2cypher-2024v1")

הרישיון

המאגר מופץ תחת רישיון Apache 2.0 המאפשר שימוש מסחרי, שינוי והפצה של הנתונים, ללא חובת שיתוף נגזרות באותו רישיון. נדרש לשמור על הודעות זכויות היוצרים והרישיון המקורי. השימוש בו לאימון מודלים מסחריים מותר מבחינת הרישיון המוצהר.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗