חֲדָשׁוֹת

מהו חיפוש וקטורי של Databricks ולמה זה חשוב

אם ביליתם זמן בניסיון להפוך מודלים של שפה גדולה (LLM) לשימושיים יותר בתוך העסק שלכם, כנראה שנתקלתם באותה בעיה: הם לא מכירים את הנתונים שלכם. אתם יכולים לכוונן אותם, בוודאי, אבל זה איטי ויקר. מה שרוב הצוותים באמת רוצים זו דרך לחבר את הידע הפנימי שלהם ולקבל תשובות חכמות ומודעות להקשר.

כאן בדיוק נכנס לתמונה Databricks Vector Search. זה לא עוד מסד נתונים וקטורי המחובר לזרימת עבודה של בינה מלאכותית. זוהי מערכת משולבת לחלוטין, ללא שרת ומוכנה לארגון, שנועדה לבניית יישומים בזמן אמת, מאובטחים וניתנים להרחבה, שמבינים בפועל את הנתונים שלכם.

מאמר זה סוקר כיצד Databricks Vector Search פועל, מדוע הוא חשוב ומה מייחד אותו מפתרונות אחרים בשוק. בין אם אתם עובדים על צינורות RAG, כלי ניהול סוכנים, או סתם רוצים חיפוש חכם יותר בפלטפורמה שלכם, זהו אחד מאותם כלים שיכולים לפתוח ערך רב מבלי להוסיף מורכבות רבה.

 

מהו בעצם חיפוש וקטורי של Databricks

Databricks Vector Search הוא מנוע חיפוש דמיון ללא שרת, המובנה ישירות בפלטפורמת Databricks. הוא נועד לעזור לצוותים למצוא תוכן רלוונטי, לא רק תואם. במקום להסתמך על חיפוש מבוסס מילות מפתח, הוא משתמש בהטמעות - ייצוגים מתמטיים של משמעות - כדי לאתר פריטים דומים בהקשר, גם כאשר הניסוח המדויק שונה.

מה שמייחד אותו ממסדי נתונים וקטוריים עצמאיים הוא העומק שלו משתלב עם שאר המערכת האקולוגית של Databricks. זה לא סתם תכונה נוספה. זה שזור במארג של הפלטפורמה.

הנה מה שזה באמת עושה מתחת למכסה המנוע:

  • מאחסן וקטורים בעלי מימדים גבוהים יחד עם מטא-דאטה נלווים, ומעניק לך גמישות מלאה לכלול דברים כמו הפניות למקורות, סוג מסמך, חותמות זמן או תגיות מותאמות אישית.
  • מסתנכרן אוטומטית עם טבלאות Delta Lake, כך שאינדקס הווקטורים שלך נשאר מעודכן ככל שנתוני המקור שלך משתנים - אין צורך בצינורות מותאמים אישית או בתהליכים חיצוניים.
  • תומך הן בהטמעות המנוהלות על ידי Databricks והן בהטמעות מותאמות אישית, ומאפשר לך להשתמש במודלים הפנימיים של Databricks או להביא משלך, בהתאם למקרה השימוש שלך.
  • משתלב עם Unity Catalog, מה שאומר שכל בקרות הגישה, שושלת הנתונים ורישום הביקורת שלך משתרעות באופן טבעי על חיפוש וקטורים. אינך צריך לשכפל כללים או להגדיר הרשאות צל.
  • מספק שאילתות דמיון מהירות ובעלות השהייה נמוכה, אפילו בקנה מידה גדול, הודות לשרת אחורי ללא שרת שמטפל בקנה המידה והאופטימיזציה עבורך.

הגדרה זו מעניקה לך את כל היתרונות של חיפוש וקטורים - תוצאות עשירות יותר, התאמת הקשר טובה יותר, סינון חכם יותר - מבלי שתצטרך להגדיר או לתחזק מסד נתונים או תשתית נפרדים.

אם אתם כבר מאחסנים את הנתונים שלכם ב-Delta Lake ומנהלים את הגישה דרך Unity Catalog, אין צורך לחבר דבר נוסף. אינכם צריכים לבנות צינורות כדי להעתיק נתונים למערכת אחרת, לנהל משימות ETL רק לחיפוש, או להוסיף שכבת ממשל נפרדת. הכל קורה במקום אחד, באמצעות כלים שהצוות שלכם כבר מכיר.

אינטגרציה מסוג זה לא רק חוסכת זמן - היא עוזרת לצוותים להימנע מארכיטקטורות שבירות ופתרונות עוקפים שאינם ניתנים להרחבה. במקום לבזבז שבועות על תחזוקת קוד דביק, אתם מתמקדים בבניית תכונות שמשתמשים רואים בפועל. וכאשר מקרה השימוש שלכם מתפתח, הבסיס כבר קיים כדי לגדול איתו.

אבני בניין מרכזיות (ומדוע הן חשובות)

הבנת אופן פעולת חיפוש וקטורים פירושה הבנת ארבעת החלקים העיקריים שמתאחדים מאחורי הקלעים:

1. שולחנות דלתא

כאן נמצאים נתוני המקור שלכם. ניתן לאחסן כאן כל מסמך, אינטראקציה עם לקוח או נכס לא מובנה. הייחודי הוא שניתן לסנכרן אוטומטית את אינדקס הווקטורים עם טבלאות אלו, כך שכאשר מתווספים נתונים חדשים, אינדקס החיפוש מתעדכן בזמן אמת.

2. הגשה לדוגמה

כדי להפוך טקסט (או תמונות, אודיו וכו') לווקטורים, אתם זקוקים למודלים של הטמעה. Databricks מאפשר לכם להשתמש במודלים המתארחים שלהם או להביא משלכם. זה שימושי במיוחד עבור צוותים שרוצים שליטה עדינה על אופן יצירת ההטמעות שלהם או רוצים להשתמש במודלים קנייניים.

3. אינדקס וקטורי ונקודות קצה

כאן נמצאים נתוני הווקטור שלך לאחר שהם מוטמעים. נקודת הקצה היא הממשק בו אתה משתמש כדי לבצע שאילתה עליהם - אתה שולח הנחיה, והיא מחזירה מסמכים דומים. היא פועלת על גבי מחשוב מנוהל וניתן להרחבה מבלי שתצטרך להפעיל תשתית.

4. קטלוג יוניטי

במקום להרחיב על ניהול, Vector Search משלבת את זה. Unity Catalog מבטיח שבקרת גישה מבוססת תפקידים, ייחוס וביקורת, כולם עוברים להטמעות ולתוצאות החיפוש שלך. זה לא נפוץ ברוב הגדרות מסד הנתונים של וקטור.

 

מקרי שימוש מהעולם האמיתי שעובדים בפועל

בעוד שהרבה מההייפ סביב חיפוש וקטורים הוא מופשט, ל-Databricks יש כמה מקרי שימוש מבוססים מאוד שכבר נמצאים בתהליכי ייצור. הנה כמה דוגמאות בולטות:

סיוע לסוכנים במרכזי שירות טלפוני

חברות כמו Lippert משתמשות ב-Vector Search כדי לשלוף תשובות ממדריכי משתמש, יומני תמיכה ותוכן הדרכה - והכל בזמן אמת. כאשר סוכנים מקלידים שאלת לקוח, המערכת חושפת את הקטעים הרלוונטיים ביותר באופן מיידי. זה עוזר להפחית את זמן ההדרכה, להגביר את מהירות הפתרון ולשמור על איכות התמיכה עקבית.

מאגרי ידע בתחום הבינה המלאכותית

דמיינו לעצמכם שאתם שואלים את הצ'אטבוט הפנימי שלכם, "מהי המדיניות שלנו בנוגע לסיום חוזים?" ומקבלים את הקטע הנכון ממסמך משאבי אנוש בן 70 עמודים. בעזרת Vector Search, תואר שני במשפטים (LLMs) יכולים להשתמש בהטמעות כדי לאחזר את התוכן המדויק שחשוב, ולא רק את מילת המפתח המתאימה ביותר.

חיפוש מוצרים סמנטי

עבור חברות עם קטלוגים מורכבים, קשה לחזות בדיוק כיצד לקוחות ינסחו את מה שהם רוצים. חיפוש וקטורי מאפשר חיפוש לפי משמעות, כך ששאילתות כמו "מחשב נייד לעריכת וידאו" יכולות להחזיר אפשרויות עם GPU גבוה, ולא רק רישומים המשתמשים בביטוי "עריכת וידאו".“

 

עבודה עם חיפוש וקטורי של Databricks בקנה מידה גדול: נקודת המבט שלנו

בְּ מוביאן, אנו בונים פלטפורמות דיגיטליות שצריכות לתפקד תחת לחץ של העולם האמיתי. בין אם מדובר בפורטל שירותי בריאות המשרת אלפי משתמשים או בכלי ארגוני המנהל זרימות עבודה רגישות, דבר אחד עקבי בכל הפרויקטים שלנו: גישה מהירה, מדויקת ומאובטחת למידע חשוב.

זו הסיבה שאנו מקדישים תשומת לב רבה ל-Databricks Vector Search. היכולת שלו לשלב חיפוש סמנטי עם ניהול מקורי, סנכרון בזמן אמת וארכיטקטורה מלאה ללא שרתים תואמת באופן הדוק את הגישה שלנו לפיתוח מוצרים. אנחנו לא רק כותבים קוד או פורסים מודלים - אנחנו פותרים בעיות שתלויות ברלוונטיות, קנה מידה ואבטחה המובנים מהיום הראשון.

כשאנחנו משלבים תוכניות לימודים לתואר שני או יכולות חיפוש בפתרון לקוח, אנחנו לא רוצים לבזבז שבועות בבניית צינורות שבירים או בהתמודדות עם בקרת גישה. Databricks מאפשר לנו לחבר חיפוש וקטורי ישירות לאותה ארכיטקטורת דלתא שאנחנו כבר משתמשים בה, מה ששומר על הכל פשוט, מהיר ובטוח יותר. עבור צוותים כמו שלנו שמתמקדים בביצועים לטווח ארוך, ולא רק בתכונות נוצצות, זהו ניצחון גדול.

 

סוגי אינדקסים: סינכרון דלתא לעומת גישה ישירה

בעת הגדרת אינדקס חיפוש וקטורי, יש לך שתי אפשרויות בהתאם לכמות השליטה שאתה זקוק לה:

אינדקס דלתא סינכרון

  • מסתנכרן אוטומטית עם טבלת דלתא
  • מעולה לשינוי מתמיד של מערכי נתונים
  • ניתן להשתמש בהטמעות מובנות של Databricks
  • מנוהל במלואו וללא שרת

זהו המסלול המהיר יותר עבור רוב הצוותים. אתם מתמקדים בנתונים ובשאילתות שלכם, והמערכת מטפלת בשאר.

אינדקס גישה ישירה

  • נותן לך שליטה מלאה על מה שנכתב ומתי
  • תומך בקליטה ידנית של וקטורים
  • מאפשר לך להשתמש בצינור ההטמעה שלך
  • אידיאלי עבור מערכי נתונים סטטיים או בעלי שינויים נמוכים

זה עדיף לצוותים שרוצים שליטה הדוקה יותר או שעושים משהו ניסיוני יותר עם הטמעות.

 

ביצועים וקנה מידה

Databricks Vector Search נבנה בבירור עם עומסי עבודה רציניים בראש. על פי Databricks, נקודת קצה אחת יכולה להתמודד עם עד מיליארד וקטורים, מה שמציב אותה בנוחות בטווח הנדרש ליישומים ברמת ארגון. בנוסף לכך, המערכת תומכת בכל 30 עד 200 שאילתות לשנייה, בהתאם למורכבות ולתצורה. תפוקה מסוג זה מאפשרת לך לבנות אפליקציות בזמן אמת או לשלב אותה בזרימות עבודה עמוסות מבלי לדאוג לגבי השהייה או עומס יתר.

מה שבולט הוא שכל זה קורה בסביבה ללא שרת. אינכם צריכים לחשוב על הקצאת מחשוב או הגדלת תשתית כאשר התנועה עולה. זה פשוט עובד. ובבדיקות ביצועים המשתמשות בהטמעות OpenAI, Databricks מדווחת על ביצועים מהירים עד פי חמישה מכמה ממסדי הנתונים הווקטוריים המובילים שקיימים. כמובן, התוצאות ישתנו בהתאם לפרטים הספציפיים של מקרה השימוש שלכם, אך העיצוב בבירור שם עדיפות למהירות, גמישות ופשטות.

 

ממשל בלי כאבי ראש

אחת התכונות הכי פחות מוערכות כאן היא ניהול. ברוב הגדרות מסד הנתונים הווקטורי, צריך להוסיף שכבת אבטחה חיצונית או לשמור על היגיון משלכם לגבי מי רואה מה.

Databricks מדלגת על כל זה על ידי שילוב הדוק עם Unity Catalog, המספק:

  • בקרת גישה מדויקת
  • יומני ביקורת ומעקב אחר שושלת
  • אכיפת מדיניות מרכזית
  • נראות על השימוש בנתונים

זו לא רק נוחות - זוהי הכרח בתעשיות כמו פיננסים, שירותי בריאות והמגזר הציבורי, שבהן הגישה לנתונים מוסדרת בקפדנות.

כמה דברים שכדאי לזכור

חיפוש וקטורי הוא כלי רב עוצמה, אך אינו קסום. הנה כמה הערות מעשיות:

  • בחרו הטמעות בחוכמה: זבל נכנס, זבל יוצא. אם המודל שלכם לא לוכד את הניואנסים החשובים לכם, תוצאות החיפוש שלכם ייראו לא נכונות.
  • צפו בממדים וקטוריים: ממדים גבוהים יותר משמעותם הטמעות אקספרסיביות יותר, אך הם גם מגדילים את עלויות האחסון והחישוב.
  • אל תדלגו על מטא-דאטה: אחסון הקשר שימושי (כגון מקור, תגיות, חותמות זמן) מקל על עיבוד וסינון לאחר מכן.
  • אבטחה חשובה: רק בגלל שהטמעות הן מופשטות, זה לא אומר שהן בטוחות. התייחסו אליהן כמו למידע רגיש.

 

מחשבות אחרונות

Databricks Vector Search אינו סתם עוד כלי שנוסף לערימה. זהו רכיב שנבנה בקפידה ומוכן לארגון, שמביא חיפוש וקטורים ישירות לזרימות העבודה הקיימות של הנתונים שלכם. אם אתם כבר משתמשים ב-Delta, Unity Catalog ו-LLMs המתארחים על ידי Databricks, זה פשוט הגיוני.

מה שהופך אותו למרתק אינו רק ביצועים או אינטגרציות - אלא העובדה שהוא מסיר חיכוכים בכל שלב. אינכם צריכים לבנות צינורות תהליכים, לשמור על תשתית או להמציא מחדש את הממשל.

אתה פשוט מפעיל את זה ומתחיל לבנות כלים חכמים ומהירים יותר שבאמת מבינים מה המשמעות של הנתונים שלך.

שאלות נפוצות

האם ניתן להשתמש ב-Databricks Vector Search מבלי להשקיע עמוקות בשאר פלטפורמת Databricks?

טכנית, כן - אבל הערך האמיתי מתגלה כשאתם כבר משתמשים ב-Delta Lake וב-Unity Catalog. אם אתם שוקלים הכל על Databricks, האינטגרציה מרגישה חלקה. אם לא, זה עלול להיות מוגזם בהשוואה למסד נתונים וקטורי קל יותר, אלא אם כן אתם מתכננים להתרחב במהירות.


האם חיפוש וקטורים תומך בהטמעות מותאמות אישית?

בהחלט. אתם יכולים להשתמש במודלים המנוהלים על ידי Databricks או לחבר צינור הטמעה משלכם. בין אם אתם עובדים עם OpenAI, Hugging Face או משהו פנימי, אתם יכולים להביא הטמעות משלכם ועדיין להשתמש בתכונות האינדוקס והחיפוש.


במה זה שונה ממשהו כמו Pinecone או Weaviate?

ההבדל הגדול ביותר הוא היכן הוא ממוקם. Pinecone ו-Weaviate הם כלים עצמאיים. Databricks Vector Search אפוי בתוך אגם הנתונים. משמעות הדבר היא בקרת גישה מקורית, סנכרון אוטומטי מטבלאות דלתא ופחות חלקים נעים לניהול.