[PR #350] [MERGED] feat(langchain): retrieval documentation #662

Closed
opened 2026-02-17 17:20:52 -05:00 by yindo · 0 comments
Owner

📋 Pull Request Information

Original PR: https://github.com/langchain-ai/docs/pull/350
Author: @eyurtsev
Created: 9/3/2025
Status: Merged
Merged: 9/5/2025
Merged by: @eyurtsev

Base: mainHead: eugene/retrieval_2


📝 Commits (10+)

  • 1f22164 x
  • 3ba4ffe Merge branch 'main' into eugene/retrieval_2
  • f30000d Update src/oss/langchain-retrieval.mdx
  • 9a30d24 Update src/oss/langchain-retrieval.mdx
  • e31ad8e Merge branch 'main' into eugene/retrieval_2
  • 457feb4 (retrieval): add text splitters (#356)
  • d09700e x
  • 9c2579e Update src/oss/langchain-retrieval.mdx
  • cc942c3 Merge branch 'main' into eugene/retrieval_2
  • 6c34a5f x

📊 Changes

11 files changed (+2491 additions, -12 deletions)

View changed files

📝 src/docs.json (+1 -1)
📝 src/oss/langchain-retrieval.mdx (+300 -7)
src/oss/python/integrations/splitters/character_text_splitter.md (+62 -0)
src/oss/python/integrations/splitters/code_splitter.md (+587 -0)
src/oss/python/integrations/splitters/index.md (+85 -0)
src/oss/python/integrations/splitters/markdown_header_metadata_splitter.md (+172 -0)
src/oss/python/integrations/splitters/recursive_json_splitter.md (+135 -0)
src/oss/python/integrations/splitters/recursive_text_splitter.md (+89 -0)
src/oss/python/integrations/splitters/split_by_token.md (+400 -0)
src/oss/python/integrations/splitters/split_html.md (+656 -0)
📝 src/oss/python/integrations/splitters/writer.md (+4 -4)

📄 Description

  • Adds basic outline for retrieval.
  • Adds text splitting (python only).
  • Other components are documented in separate PRs.

We need to follow up with:

  1. Additional editing passes on retrieval
  2. js translation
  3. tutorials

Outline:

  1. Introduce retrieval in the context of llms/agents (i.e., why is it necessary)
  2. Potentially explain how to incorporate context (i.e., via model prompt in either system, human message or tool message) -- not there atm since maybe it's too excessive
  3. Discuss RAG architectures
  4. Discuss Building a custom knowledge base <-- This what was slotted to go there originally

For references:

LangChain concepts:

How-tos:


🔄 This issue represents a GitHub Pull Request. It cannot be merged through Gitea due to API limitations.

## 📋 Pull Request Information **Original PR:** https://github.com/langchain-ai/docs/pull/350 **Author:** [@eyurtsev](https://github.com/eyurtsev) **Created:** 9/3/2025 **Status:** ✅ Merged **Merged:** 9/5/2025 **Merged by:** [@eyurtsev](https://github.com/eyurtsev) **Base:** `main` ← **Head:** `eugene/retrieval_2` --- ### 📝 Commits (10+) - [`1f22164`](https://github.com/langchain-ai/docs/commit/1f22164f5622d00b4d4251d2c61e910e7d582bce) x - [`3ba4ffe`](https://github.com/langchain-ai/docs/commit/3ba4ffee8b5fa8c60b3b9ca609c8bab4f5e9240e) Merge branch 'main' into eugene/retrieval_2 - [`f30000d`](https://github.com/langchain-ai/docs/commit/f30000d304aa13490676b9f4679a7d2d65a5624e) Update src/oss/langchain-retrieval.mdx - [`9a30d24`](https://github.com/langchain-ai/docs/commit/9a30d244e6adaefc65a8958a5bdfcbdef229ac88) Update src/oss/langchain-retrieval.mdx - [`e31ad8e`](https://github.com/langchain-ai/docs/commit/e31ad8e9d00bb7df07d0eab27daf7674d1a97ca9) Merge branch 'main' into eugene/retrieval_2 - [`457feb4`](https://github.com/langchain-ai/docs/commit/457feb4f4496b51185eb662b3a1c1f6d0515048b) (retrieval): add text splitters (#356) - [`d09700e`](https://github.com/langchain-ai/docs/commit/d09700ef7094242568bad50a49e5a207e99a9b03) x - [`9c2579e`](https://github.com/langchain-ai/docs/commit/9c2579e7c0d6369875c0b49ce54c9575d9f605a3) Update src/oss/langchain-retrieval.mdx - [`cc942c3`](https://github.com/langchain-ai/docs/commit/cc942c30508be7ba3a1bee2bd16bc46281674941) Merge branch 'main' into eugene/retrieval_2 - [`6c34a5f`](https://github.com/langchain-ai/docs/commit/6c34a5f5c386b20b992f1e961f6bd303073d0137) x ### 📊 Changes **11 files changed** (+2491 additions, -12 deletions) <details> <summary>View changed files</summary> 📝 `src/docs.json` (+1 -1) 📝 `src/oss/langchain-retrieval.mdx` (+300 -7) ➕ `src/oss/python/integrations/splitters/character_text_splitter.md` (+62 -0) ➕ `src/oss/python/integrations/splitters/code_splitter.md` (+587 -0) ➕ `src/oss/python/integrations/splitters/index.md` (+85 -0) ➕ `src/oss/python/integrations/splitters/markdown_header_metadata_splitter.md` (+172 -0) ➕ `src/oss/python/integrations/splitters/recursive_json_splitter.md` (+135 -0) ➕ `src/oss/python/integrations/splitters/recursive_text_splitter.md` (+89 -0) ➕ `src/oss/python/integrations/splitters/split_by_token.md` (+400 -0) ➕ `src/oss/python/integrations/splitters/split_html.md` (+656 -0) 📝 `src/oss/python/integrations/splitters/writer.md` (+4 -4) </details> ### 📄 Description * Adds basic outline for retrieval. * Adds text splitting (python only). * Other components are documented in separate PRs. We need to follow up with: 1. Additional editing passes on retrieval 2. js translation 3. tutorials Outline: 1. Introduce retrieval in the context of llms/agents (i.e., why is it necessary) 4. Potentially explain how to incorporate context (i.e., via model prompt in either system, human message or tool message) -- not there atm since maybe it's too excessive 5. Discuss RAG architectures 6. Discuss Building a custom knowledge base <-- This what was slotted to go there originally For references: LangChain concepts: * https://python.langchain.com/docs/concepts/vectorstores/ * https://python.langchain.com/docs/concepts/retrievers/ * https://python.langchain.com/docs/concepts/retrieval/ * https://python.langchain.com/docs/concepts/rag/ * https://python.langchain.com/docs/concepts/text_splitters/ * https://python.langchain.com/docs/concepts/embedding_models/ * https://python.langchain.com/docs/concepts/document_loaders/ How-tos: * https://python.langchain.com/docs/how_to/#text-splitters * highlight specific integrations? * https://python.langchain.com/docs/how_to/#embedding-models * highlight: init_embeddings_model, cached backed embeddings * what to do with custom embeddings model? (we won't include now, but where would those go?) * https://python.langchain.com/docs/how_to/#retrievers * highlight: create retriever from vectorstore, custom retriever? * https://python.langchain.com/docs/how_to/#document-loaders * highlight specific integrations? (e.g., PDF, CSV, HTML, JSON, markdown, ..) * highlight later?: https://python.langchain.com/docs/how_to/document_loader_custom/ ? (it's a little known page) --- <sub>🔄 This issue represents a GitHub Pull Request. It cannot be merged through Gitea due to API limitations.</sub>
yindo added the pull-request label 2026-02-17 17:20:52 -05:00
yindo closed this issue 2026-02-17 17:20:52 -05:00
Sign in to join this conversation.
1 Participants
Notifications
Due Date
No due date set.
Dependencies

No dependencies set.

Reference: langchain-ai/docs#662