mirror of
https://github.com/Mintplex-Labs/langchain-python.git
synced 2026-07-19 21:33:31 -04:00
9d1bd18596
<!-- Thank you for contributing to LangChain! Your PR will appear in our release under the title you set. Please make sure it highlights your valuable contribution. Replace this with a description of the change, the issue it fixes (if applicable), and relevant context. List any dependencies required for this change. After you're done, someone will review your PR. They may suggest improvements. If no one reviews your PR within a few days, feel free to @-mention the same people again, as notifications can get lost. Finally, we'd love to show appreciation for your contribution - if you'd like us to shout you out on Twitter, please also include your handle! --> <!-- Remove if not applicable --> ### Summary This PR adds a LarkSuite (FeiShu) document loader. > [LarkSuite](https://www.larksuite.com/) is an enterprise collaboration platform developed by ByteDance. ### Tests - an integration test case is added - an example notebook showing usage is added. [Notebook preview](https://github.com/yaohui-wyh/langchain/blob/master/docs/extras/modules/data_connection/document_loaders/integrations/larksuite.ipynb) <!-- If you're adding a new integration, please include: 1. a test for the integration - favor unit tests that does not rely on network access. 2. an example notebook showing its use See contribution guidelines for more information on how to write tests, lint etc: https://github.com/hwchase17/langchain/blob/master/.github/CONTRIBUTING.md --> ### Who can review? - PTAL @eyurtsev @hwchase17 <!-- For a quicker response, figure out the right person to tag with @ @hwchase17 - project lead Tracing / Callbacks - @agola11 Async - @agola11 DataLoaders - @eyurtsev Models - @hwchase17 - @agola11 Agents / Tools / Toolkits - @hwchase17 VectorStores / Retrievers / Memory - @dev2049 --> --------- Co-authored-by: Yaohui Wang <wangyaohui.01@bytedance.com>
287 lines
11 KiB
Python
287 lines
11 KiB
Python
"""All different types of document loaders."""
|
|
|
|
from langchain.document_loaders.acreom import AcreomLoader
|
|
from langchain.document_loaders.airbyte_json import AirbyteJSONLoader
|
|
from langchain.document_loaders.airtable import AirtableLoader
|
|
from langchain.document_loaders.apify_dataset import ApifyDatasetLoader
|
|
from langchain.document_loaders.arxiv import ArxivLoader
|
|
from langchain.document_loaders.azlyrics import AZLyricsLoader
|
|
from langchain.document_loaders.azure_blob_storage_container import (
|
|
AzureBlobStorageContainerLoader,
|
|
)
|
|
from langchain.document_loaders.azure_blob_storage_file import (
|
|
AzureBlobStorageFileLoader,
|
|
)
|
|
from langchain.document_loaders.bibtex import BibtexLoader
|
|
from langchain.document_loaders.bigquery import BigQueryLoader
|
|
from langchain.document_loaders.bilibili import BiliBiliLoader
|
|
from langchain.document_loaders.blackboard import BlackboardLoader
|
|
from langchain.document_loaders.blob_loaders import (
|
|
Blob,
|
|
BlobLoader,
|
|
FileSystemBlobLoader,
|
|
YoutubeAudioLoader,
|
|
)
|
|
from langchain.document_loaders.blockchain import BlockchainDocumentLoader
|
|
from langchain.document_loaders.chatgpt import ChatGPTLoader
|
|
from langchain.document_loaders.college_confidential import CollegeConfidentialLoader
|
|
from langchain.document_loaders.confluence import ConfluenceLoader
|
|
from langchain.document_loaders.conllu import CoNLLULoader
|
|
from langchain.document_loaders.csv_loader import CSVLoader, UnstructuredCSVLoader
|
|
from langchain.document_loaders.dataframe import DataFrameLoader
|
|
from langchain.document_loaders.diffbot import DiffbotLoader
|
|
from langchain.document_loaders.directory import DirectoryLoader
|
|
from langchain.document_loaders.discord import DiscordChatLoader
|
|
from langchain.document_loaders.docugami import DocugamiLoader
|
|
from langchain.document_loaders.duckdb_loader import DuckDBLoader
|
|
from langchain.document_loaders.email import (
|
|
OutlookMessageLoader,
|
|
UnstructuredEmailLoader,
|
|
)
|
|
from langchain.document_loaders.embaas import EmbaasBlobLoader, EmbaasLoader
|
|
from langchain.document_loaders.epub import UnstructuredEPubLoader
|
|
from langchain.document_loaders.evernote import EverNoteLoader
|
|
from langchain.document_loaders.excel import UnstructuredExcelLoader
|
|
from langchain.document_loaders.facebook_chat import FacebookChatLoader
|
|
from langchain.document_loaders.fauna import FaunaLoader
|
|
from langchain.document_loaders.figma import FigmaFileLoader
|
|
from langchain.document_loaders.gcs_directory import GCSDirectoryLoader
|
|
from langchain.document_loaders.gcs_file import GCSFileLoader
|
|
from langchain.document_loaders.git import GitLoader
|
|
from langchain.document_loaders.gitbook import GitbookLoader
|
|
from langchain.document_loaders.github import GitHubIssuesLoader
|
|
from langchain.document_loaders.googledrive import GoogleDriveLoader
|
|
from langchain.document_loaders.gutenberg import GutenbergLoader
|
|
from langchain.document_loaders.hn import HNLoader
|
|
from langchain.document_loaders.html import UnstructuredHTMLLoader
|
|
from langchain.document_loaders.html_bs import BSHTMLLoader
|
|
from langchain.document_loaders.hugging_face_dataset import HuggingFaceDatasetLoader
|
|
from langchain.document_loaders.ifixit import IFixitLoader
|
|
from langchain.document_loaders.image import UnstructuredImageLoader
|
|
from langchain.document_loaders.image_captions import ImageCaptionLoader
|
|
from langchain.document_loaders.imsdb import IMSDbLoader
|
|
from langchain.document_loaders.iugu import IuguLoader
|
|
from langchain.document_loaders.joplin import JoplinLoader
|
|
from langchain.document_loaders.json_loader import JSONLoader
|
|
from langchain.document_loaders.larksuite import LarkSuiteDocLoader
|
|
from langchain.document_loaders.markdown import UnstructuredMarkdownLoader
|
|
from langchain.document_loaders.mastodon import MastodonTootsLoader
|
|
from langchain.document_loaders.max_compute import MaxComputeLoader
|
|
from langchain.document_loaders.mediawikidump import MWDumpLoader
|
|
from langchain.document_loaders.merge import MergedDataLoader
|
|
from langchain.document_loaders.mhtml import MHTMLLoader
|
|
from langchain.document_loaders.modern_treasury import ModernTreasuryLoader
|
|
from langchain.document_loaders.notebook import NotebookLoader
|
|
from langchain.document_loaders.notion import NotionDirectoryLoader
|
|
from langchain.document_loaders.notiondb import NotionDBLoader
|
|
from langchain.document_loaders.obsidian import ObsidianLoader
|
|
from langchain.document_loaders.odt import UnstructuredODTLoader
|
|
from langchain.document_loaders.onedrive import OneDriveLoader
|
|
from langchain.document_loaders.onedrive_file import OneDriveFileLoader
|
|
from langchain.document_loaders.open_city_data import OpenCityDataLoader
|
|
from langchain.document_loaders.org_mode import UnstructuredOrgModeLoader
|
|
from langchain.document_loaders.pdf import (
|
|
MathpixPDFLoader,
|
|
OnlinePDFLoader,
|
|
PDFMinerLoader,
|
|
PDFMinerPDFasHTMLLoader,
|
|
PDFPlumberLoader,
|
|
PyMuPDFLoader,
|
|
PyPDFDirectoryLoader,
|
|
PyPDFium2Loader,
|
|
PyPDFLoader,
|
|
UnstructuredPDFLoader,
|
|
)
|
|
from langchain.document_loaders.powerpoint import UnstructuredPowerPointLoader
|
|
from langchain.document_loaders.psychic import PsychicLoader
|
|
from langchain.document_loaders.pyspark_dataframe import PySparkDataFrameLoader
|
|
from langchain.document_loaders.python import PythonLoader
|
|
from langchain.document_loaders.readthedocs import ReadTheDocsLoader
|
|
from langchain.document_loaders.recursive_url_loader import RecursiveUrlLoader
|
|
from langchain.document_loaders.reddit import RedditPostsLoader
|
|
from langchain.document_loaders.roam import RoamLoader
|
|
from langchain.document_loaders.rst import UnstructuredRSTLoader
|
|
from langchain.document_loaders.rtf import UnstructuredRTFLoader
|
|
from langchain.document_loaders.s3_directory import S3DirectoryLoader
|
|
from langchain.document_loaders.s3_file import S3FileLoader
|
|
from langchain.document_loaders.sitemap import SitemapLoader
|
|
from langchain.document_loaders.slack_directory import SlackDirectoryLoader
|
|
from langchain.document_loaders.snowflake_loader import SnowflakeLoader
|
|
from langchain.document_loaders.spreedly import SpreedlyLoader
|
|
from langchain.document_loaders.srt import SRTLoader
|
|
from langchain.document_loaders.stripe import StripeLoader
|
|
from langchain.document_loaders.telegram import (
|
|
TelegramChatApiLoader,
|
|
TelegramChatFileLoader,
|
|
)
|
|
from langchain.document_loaders.tencent_cos_directory import TencentCOSDirectoryLoader
|
|
from langchain.document_loaders.tencent_cos_file import TencentCOSFileLoader
|
|
from langchain.document_loaders.text import TextLoader
|
|
from langchain.document_loaders.tomarkdown import ToMarkdownLoader
|
|
from langchain.document_loaders.toml import TomlLoader
|
|
from langchain.document_loaders.trello import TrelloLoader
|
|
from langchain.document_loaders.twitter import TwitterTweetLoader
|
|
from langchain.document_loaders.unstructured import (
|
|
UnstructuredAPIFileIOLoader,
|
|
UnstructuredAPIFileLoader,
|
|
UnstructuredFileIOLoader,
|
|
UnstructuredFileLoader,
|
|
)
|
|
from langchain.document_loaders.url import UnstructuredURLLoader
|
|
from langchain.document_loaders.url_playwright import PlaywrightURLLoader
|
|
from langchain.document_loaders.url_selenium import SeleniumURLLoader
|
|
from langchain.document_loaders.weather import WeatherDataLoader
|
|
from langchain.document_loaders.web_base import WebBaseLoader
|
|
from langchain.document_loaders.whatsapp_chat import WhatsAppChatLoader
|
|
from langchain.document_loaders.wikipedia import WikipediaLoader
|
|
from langchain.document_loaders.word_document import (
|
|
Docx2txtLoader,
|
|
UnstructuredWordDocumentLoader,
|
|
)
|
|
from langchain.document_loaders.xml import UnstructuredXMLLoader
|
|
from langchain.document_loaders.youtube import (
|
|
GoogleApiClient,
|
|
GoogleApiYoutubeLoader,
|
|
YoutubeLoader,
|
|
)
|
|
|
|
# Legacy: only for backwards compat. Use PyPDFLoader instead
|
|
PagedPDFSplitter = PyPDFLoader
|
|
|
|
# For backwards compatability
|
|
TelegramChatLoader = TelegramChatFileLoader
|
|
|
|
__all__ = [
|
|
"AcreomLoader",
|
|
"AZLyricsLoader",
|
|
"AirbyteJSONLoader",
|
|
"AirtableLoader",
|
|
"ApifyDatasetLoader",
|
|
"ArxivLoader",
|
|
"AzureBlobStorageContainerLoader",
|
|
"AzureBlobStorageFileLoader",
|
|
"BSHTMLLoader",
|
|
"BibtexLoader",
|
|
"BigQueryLoader",
|
|
"BiliBiliLoader",
|
|
"BlackboardLoader",
|
|
"Blob",
|
|
"BlobLoader",
|
|
"BlockchainDocumentLoader",
|
|
"CSVLoader",
|
|
"ChatGPTLoader",
|
|
"CoNLLULoader",
|
|
"CollegeConfidentialLoader",
|
|
"ConfluenceLoader",
|
|
"DataFrameLoader",
|
|
"DiffbotLoader",
|
|
"DirectoryLoader",
|
|
"DiscordChatLoader",
|
|
"DocugamiLoader",
|
|
"Docx2txtLoader",
|
|
"DuckDBLoader",
|
|
"EmbaasBlobLoader",
|
|
"EmbaasLoader",
|
|
"EverNoteLoader",
|
|
"FacebookChatLoader",
|
|
"FaunaLoader",
|
|
"FigmaFileLoader",
|
|
"FileSystemBlobLoader",
|
|
"GCSDirectoryLoader",
|
|
"GCSFileLoader",
|
|
"GitHubIssuesLoader",
|
|
"GitLoader",
|
|
"GitbookLoader",
|
|
"GoogleApiClient",
|
|
"GoogleApiYoutubeLoader",
|
|
"GoogleDriveLoader",
|
|
"GutenbergLoader",
|
|
"HNLoader",
|
|
"HuggingFaceDatasetLoader",
|
|
"HuggingFaceDatasetLoader",
|
|
"IFixitLoader",
|
|
"IMSDbLoader",
|
|
"ImageCaptionLoader",
|
|
"IuguLoader",
|
|
"JSONLoader",
|
|
"JoplinLoader",
|
|
"LarkSuiteDocLoader",
|
|
"MWDumpLoader",
|
|
"MastodonTootsLoader",
|
|
"MathpixPDFLoader",
|
|
"MaxComputeLoader",
|
|
"MergedDataLoader",
|
|
"MHTMLLoader",
|
|
"ModernTreasuryLoader",
|
|
"NotebookLoader",
|
|
"NotionDBLoader",
|
|
"NotionDirectoryLoader",
|
|
"ObsidianLoader",
|
|
"OneDriveFileLoader",
|
|
"OneDriveLoader",
|
|
"OnlinePDFLoader",
|
|
"OutlookMessageLoader",
|
|
"OpenCityDataLoader",
|
|
"PDFMinerLoader",
|
|
"PDFMinerPDFasHTMLLoader",
|
|
"PDFPlumberLoader",
|
|
"PagedPDFSplitter",
|
|
"PlaywrightURLLoader",
|
|
"PsychicLoader",
|
|
"PyMuPDFLoader",
|
|
"PyPDFDirectoryLoader",
|
|
"PyPDFLoader",
|
|
"PyPDFium2Loader",
|
|
"PySparkDataFrameLoader",
|
|
"PythonLoader",
|
|
"ReadTheDocsLoader",
|
|
"RecursiveUrlLoader",
|
|
"RedditPostsLoader",
|
|
"RoamLoader",
|
|
"S3DirectoryLoader",
|
|
"S3FileLoader",
|
|
"SRTLoader",
|
|
"SeleniumURLLoader",
|
|
"SitemapLoader",
|
|
"SlackDirectoryLoader",
|
|
"SnowflakeLoader",
|
|
"SpreedlyLoader",
|
|
"StripeLoader",
|
|
"TencentCOSDirectoryLoader",
|
|
"TencentCOSFileLoader",
|
|
"TelegramChatApiLoader",
|
|
"TelegramChatFileLoader",
|
|
"TelegramChatLoader",
|
|
"TextLoader",
|
|
"ToMarkdownLoader",
|
|
"TomlLoader",
|
|
"TrelloLoader",
|
|
"TwitterTweetLoader",
|
|
"UnstructuredAPIFileIOLoader",
|
|
"UnstructuredAPIFileLoader",
|
|
"UnstructuredCSVLoader",
|
|
"UnstructuredEPubLoader",
|
|
"UnstructuredEmailLoader",
|
|
"UnstructuredExcelLoader",
|
|
"UnstructuredFileIOLoader",
|
|
"UnstructuredFileLoader",
|
|
"UnstructuredHTMLLoader",
|
|
"UnstructuredImageLoader",
|
|
"UnstructuredMarkdownLoader",
|
|
"UnstructuredODTLoader",
|
|
"UnstructuredOrgModeLoader",
|
|
"UnstructuredPDFLoader",
|
|
"UnstructuredPowerPointLoader",
|
|
"UnstructuredRSTLoader",
|
|
"UnstructuredRTFLoader",
|
|
"UnstructuredURLLoader",
|
|
"UnstructuredWordDocumentLoader",
|
|
"UnstructuredXMLLoader",
|
|
"WeatherDataLoader",
|
|
"WebBaseLoader",
|
|
"WhatsAppChatLoader",
|
|
"WikipediaLoader",
|
|
"YoutubeAudioLoader",
|
|
"YoutubeLoader",
|
|
]
|