تمام پوسٹس
  • AI
  • RAG
  • انجینئرنگ

کسٹمر سپورٹ کے لیے RAG: AI کے جوابات کو واقعی درست کیسے بنایا جائے

ایک سادہ LLM قابلِ یقین لگنے والے جواب گھڑ لیتا ہے۔ ریٹریول-آگمینٹڈ جنریشن (RAG) AI کو آپ کے اپنے مواد پر قائم رکھتی ہے۔ یہاں قدم بہ قدم دیکھیں کہ AskAIs یہ کیسے کرتا ہے۔

AskAIs ٹیم

پڑھنے میں 7 منٹ

کسی سادہ LLM سے پوچھیں “میں اپنا پاس ورڈ کیسے ری سیٹ کروں؟” تو آپ کو ایک قابلِ یقین لگنے والا جواب ملتا ہے جو غالباً غلط ہوتا ہے: کوئی اور بٹن، کوئی اور طریقہ، کوئی اور URL۔ RAG (ریٹریول-آگمینٹڈ جنریشن) اس مسئلے کو یوں حل کرتی ہے کہ ماڈل کے جواب دینے سے پہلے آپ کے اپنے مواد سے درست اقتباسات پرامپٹ میں ڈال دیتی ہے۔

پائپ لائن ایک نظر میں

تین مراحل: مواد شامل کرنا، بازیافت اور جواب بنانا۔

1. مواد شامل کرنا

  • PDF، DOCX، TXT، Markdown، CSV یا JSON فائلیں اپ لوڈ کریں، اپنی ویب سائٹ کرال کریں، یا Training میں سوال و جواب کے جوڑے شامل کریں۔
  • ورکر متن نکالتا ہے اور اسے تقریباً 2,000 حروف (لگ بھگ 500 tokens) کے اقتباسات میں تقسیم کرتا ہے، جن میں 200 حروف کا اوورلیپ ہوتا ہے۔ ہر سوال و جواب کا جوڑا ایک ہی اقتباس رہتا ہے۔
  • ہر اقتباس کی ایمبیڈنگ text-embedding-3-small (1,536 جہتیں) سے بنائی جاتی ہے۔
  • اقتباسات PostgreSQL میں pgvector ایکسٹینشن اور cosine distance کے لیے HNSW انڈیکس کے ساتھ محفوظ کیے جاتے ہیں۔

2. بازیافت

جب کسی وزیٹر کے پیغام کے لیے حقائق درکار ہوں تو ہم اس کے حالیہ پیغامات کی ایمبیڈنگ بناتے ہیں اور ورک اسپیس کے اقتباسات پر cosine distance سے تلاش چلاتے ہیں۔ سلام دعا اور عام گپ شپ میں یہ مرحلہ چھوڑ دیا جاتا ہے۔ کوئری کا ایک سادہ ورژن:

-- Simplified. The real query also checks that the document is
-- ready, enabled, in date and visible on the visitor's platform.
SELECT c.id, c.content,
       1 - (c.embedding <=> $1::vector) AS similarity
FROM knowledge_chunks c
WHERE c.tenant_id = $2
ORDER BY c.embedding <=> $1::vector
LIMIT $3;  -- 3 × top-K candidates, re-ranked afterwards

ہمیں جتنے اقتباسات درکار ہوں، ہم ان سے تین گنا زیادہ امیدوار نکالتے ہیں، انہیں دوبارہ درجہ بندی کرتے ہیں، مماثلت کی حد (تقریباً 0.3) سے نیچے والے نکال دیتے ہیں، ہر دستاویز سے زیادہ سے زیادہ دو اقتباسات رکھتے ہیں، اور سب سے اوپر کے پانچ (بطور ڈیفالٹ) ماڈل کو دیتے ہیں۔

3. جواب بنانا

اقتباسات ایک الگ حد بند حوالہ حصے کے اندر سسٹم پرامپٹ کے آخر میں شامل کیے جاتے ہیں۔ ماڈل کو کہا جاتا ہے کہ اس حصے کو ہدایات نہیں بلکہ ڈیٹا سمجھے، صرف وہی حوالے استعمال کرے جو سوال کا جواب دیتے ہوں، اور پروڈکٹ کے ایسے حقائق نہ گھڑے جو وہاں موجود نہیں۔

اگر کوئی وزیٹر پروڈکٹ سے متعلق کسی حقیقت کے بارے میں پوچھے اور کچھ متعلقہ نہ ملے تو ماڈل کو بالکل کال نہیں کیا جاتا: وزیٹر کو بتایا جاتا ہے کہ یہ معلومات دستیاب نہیں، اور چیٹ کسی انسان کے پاس چلی جاتی ہے، الا یہ کہ خودکار ہینڈ آف بند ہو۔

لاگت کم رکھنا

تین چیزیں ایک بڑے نالج بیس کو کم خرچ رکھتی ہیں:

  • ایمبیڈنگ کیش: ایک ہی سرچ متن کو ایک ہی ایمبیڈنگ ملتی ہے۔ کیش کی کلید ماڈل کا نام اور متن کا SHA-1 ہیش ہے، اور یہ Redis میں 24 گھنٹے تک رکھی جاتی ہے۔
  • پرامپٹ کیشنگ: Claude ماڈلز کے لیے درخواست Anthropic سے پرامپٹ کیش کرنے کو کہتی ہے، اور OpenAI لمبے پرامپٹس خود بخود کیش کرتا ہے۔ حوالہ حصہ ہر جواب کے ساتھ بدلتا ہے، اس لیے زیادہ تر فائدہ پرامپٹ کے مستقل حصے کو ہوتا ہے۔
  • حد کی بنیاد پر چھوڑنا: اگر کوئی اقتباس حد پار نہ کرے تو پرامپٹ میں کچھ شامل نہیں کیا جاتا۔

جب RAG کافی نہ ہو

RAG “میں … کیسے کروں؟” جیسے سوالات اچھی طرح سنبھالتی ہے۔ یہ “میرا آرڈر کہاں ہے؟” کا جواب نہیں دے سکتی، کیونکہ یہ ڈیٹا آپ کی دستاویزات میں نہیں ہوتا۔

اس کے لیے AskAIs میں Custom tools ہیں: آپ اپنے سسٹم کا کوئی HTTP اینڈ پوائنٹ بیان کرتے ہیں، جیسے آرڈرز، بکنگز یا اسٹاک، اور AI جواب لکھتے وقت اسے کال کر سکتا ہے۔ عام سوالات کا جواب آپ کے نالج سے دیا جاتا ہے، ذاتی سوالات کا آپ کے سسٹمز سے، اور باقی آپ کی ٹیم کے پاس جاتے ہیں۔

آج ہی مفت شروع کریں۔

ایک ایجنٹ، ہر ماہ 100 AI جوابات، ساتھ میں iPhone، iPad اور Android ایپ۔ ہمیشہ کے لیے مفت۔ ٹیم بڑھے تو اپ گریڈ کریں۔

  • کوئی کریڈٹ کارڈ نہیں
  • منٹوں میں سیٹ اپ