Error parsing books in other language even if the language parameter is set in LlamaParse #167

Open
opened 2026-02-16 00:17:02 -05:00 by yindo · 2 comments
Owner

Originally created by @JianXiao2021 on GitHub (Jul 1, 2024).

This is an excerpt of my book (only one page, in Russian):
Dolgan_ Язык норильских долган (Ubrjatova) 3.pdf

I put the PDF file in 'tst' folder and my code is:

from llama_parse import LlamaParse
ru_parser1 = LlamaParse(result_type="text", language="ru")
documents = SimpleDirectoryReader("./tst", file_extractor={".pdf": ru_parser1}).load_data()
print(documents[0].text)

Instead of Russian text I got something like this:

IPEIUCIOBVE
        B mpezaraeMo#tBHHaHD trarejefpadore OIECHBaETCH FBHK
TpYIH AqrAH , KOYeBaBux 4O KOHua 40 -X TOHOB                                 paitoneOoJBxx

It seems that even though I specified the language parameter as Russian, LlamaParse still recognized it as English.

When I tried another Russian book with the same code, the documents[0].text is empty, no text was extracted from the PDF file:
Orok_ Язык ороков (ульта) (Petrova) 22.pdf

Does LlamaParse not yet support the OCR of this kind of scanned foreign language PDF documents? Or did I miss something?

Originally created by @JianXiao2021 on GitHub (Jul 1, 2024). This is an excerpt of my book (only one page, in Russian): [Dolgan_ Язык норильских долган (Ubrjatova) 3.pdf](https://github.com/user-attachments/files/16060976/Dolgan_.Ubrjatova.3.pdf) I put the PDF file in 'tst' folder and my code is: ``` from llama_parse import LlamaParse ru_parser1 = LlamaParse(result_type="text", language="ru") documents = SimpleDirectoryReader("./tst", file_extractor={".pdf": ru_parser1}).load_data() print(documents[0].text) ``` Instead of Russian text I got something like this: ``` IPEIUCIOBVE B mpezaraeMo#tBHHaHD trarejefpadore OIECHBaETCH FBHK TpYIH AqrAH , KOYeBaBux 4O KOHua 40 -X TOHOB paitoneOoJBxx ``` It seems that even though I specified the language parameter as Russian, LlamaParse still recognized it as English. When I tried another Russian book with the same code, the `documents[0].text` is empty, no text was extracted from the PDF file: [Orok_ Язык ороков (ульта) (Petrova) 22.pdf](https://github.com/user-attachments/files/16061054/Orok_.Petrova.22.pdf) Does LlamaParse not yet support the OCR of this kind of scanned foreign language PDF documents? Or did I miss something?
Author
Owner

@PhySci commented on GitHub (Jul 4, 2024):

I faced the same issue. Looking forward for the reply

@PhySci commented on GitHub (Jul 4, 2024): I faced the same issue. Looking forward for the reply
Author
Owner

@tkcoding commented on GitHub (Jul 17, 2024):

@JianXiao2021 @PhySci
If you are facing this issue, you can add in `gpt4o_mode=True' .

parser = LlamaParse(gpt4o_mode=True,verbose=True)

with gpt4o_mode it basically can recognise the language by themselves.

this is the output I got:

[{'page': 1,
  'md': "падежа (дезигнатив) со сходным суффиксом, а также звуковое сходство ряда прочих падежных оформителей; с северной — главным образом форма исходного падежа и наличие совместного падежа.\n\nИмя прилагательное орокского языка имеет много сходных черт с той же категорией в языках ульчском и нанайском. Это сказывается не только в общей этим трем языкам бедности словообразовательными элементами категории прилагательных, но также и в звуковой близости имеющихся оформителей.\n\nКроме того, в противоположность языкам северной группы в языках ульчском, нанайском и орокском сравнительно широко применяется для обозначения признаков предмета сочетание, состоящее из наречия и глагола би (кок-кок би 'твердый').\n\nПо способу же согласования имен прилагательных с именами существительными язык ороков занимает промежуточное положение между языками эвенкийским и эвенским, с одной стороны, и ульчским и нанайским — с другой. Прилагательные орокского языка, как правило, не согласуются со своим определяемым словом в падеже, но согласуются в числе. Языкам северной группы — эвенкийскому и эвенскому — свойственно согласование и в числе, и в падеже, языкам ульчскому и нанайскому подобное согласование чуждо.\n\nНекоторые своеобразные черты присущи орокским числительным и местоимениям. Так, в области количественных числительных орокский язык выделяется среди прочих тунгусо-маньчжурских языков наличием для единицы особого названия гида ~ деда. Прочие отличия сводятся в значительной мере к ряду фонетических соответствий. По названию для сотни — тингу и для тысячи — минга(н) числительные орокского языка стоят в одном ряду с тунгусо-маньчжурскими языками южной группы.\n\nОтсутствие включительного местоимения объединяет орокский язык в одну группу с нанайским и ульчским.\n\nЛичные и вопросительные местоимения орокского языка типологически сходны с ульчскими. Своеобразны лишь формы личных местоимений 1-го и 2-го л. мн. ч. в винительном падеже — мунгбун, сунгбун, а также формы личных местоимений 1-го и 2-го л. ед. ч. в именительном падеже — бици, сици.\n\nВ разделе глагольных форм обращает на себя внимание тот факт, что ряд глагольных образований имеет своей основой форму активного причастия настоящего времени, что имеет место и в нанайском языке (формы настоящего и прошедшего времени изъявительного наклонения), а также в ульчском (формы настоящего, прошедшего и будущего времени изъявительного наклонения). В орокском же языке, кроме тех форм изъявительного наклонения, которые отмечены для ульчского языка, от указанной причастий образуются также формы сослагательного наклонения и повелительная форма 1-го л. ед. ч.",
  'images': [{'name': 'page.jpg', 'height': 0, 'width': 0, 'x': 0, 'y': 0}],
  'items': [{'type': 'text',
    'value': "падежа (дезигнатив) со сходным суффиксом, а также звуковое сходство ряда прочих падежных оформителей; с северной — главным образом форма исходного падежа и наличие совместного падежа.\n\nИмя прилагательное орокского языка имеет много сходных черт с той же категорией в языках ульчском и нанайском. Это сказывается не только в общей этим трем языкам бедности словообразовательными элементами категории прилагательных, но также и в звуковой близости имеющихся оформителей.\n\nКроме того, в противоположность языкам северной группы в языках ульчском, нанайском и орокском сравнительно широко применяется для обозначения признаков предмета сочетание, состоящее из наречия и глагола би (кок-кок би 'твердый').\n\nПо способу же согласования имен прилагательных с именами существительными язык ороков занимает промежуточное положение между языками эвенкийским и эвенским, с одной стороны, и ульчским и нанайским — с другой. Прилагательные орокского языка, как правило, не согласуются со своим определяемым словом в падеже, но согласуются в числе. Языкам северной группы — эвенкийскому и эвенскому — свойственно согласование и в числе, и в падеже, языкам ульчскому и нанайскому подобное согласование чуждо.\n\nНекоторые своеобразные черты присущи орокским числительным и местоимениям. Так, в области количественных числительных орокский язык выделяется среди прочих тунгусо-маньчжурских языков наличием для единицы особого названия гида ~ деда. Прочие отличия сводятся в значительной мере к ряду фонетических соответствий. По названию для сотни — тингу и для тысячи — минга(н) числительные орокского языка стоят в одном ряду с тунгусо-маньчжурскими языками южной группы.\n\nОтсутствие включительного местоимения объединяет орокский язык в одну группу с нанайским и ульчским.\n\nЛичные и вопросительные местоимения орокского языка типологически сходны с ульчскими. Своеобразны лишь формы личных местоимений 1-го и 2-го л. мн. ч. в винительном падеже — мунгбун, сунгбун, а также формы личных местоимений 1-го и 2-го л. ед. ч. в именительном падеже — бици, сици.\n\nВ разделе глагольных форм обращает на себя внимание тот факт, что ряд глагольных образований имеет своей основой форму активного причастия настоящего времени, что имеет место и в нанайском языке (формы настоящего и прошедшего времени изъявительного наклонения), а также в ульчском (формы настоящего, прошедшего и будущего времени изъявительного наклонения). В орокском же языке, кроме тех форм изъявительного наклонения, которые отмечены для ульчского языка, от указанной причастий образуются также формы сослагательного наклонения и повелительная форма 1-го л. ед. ч.",
    'md': "падежа (дезигнатив) со сходным суффиксом, а также звуковое сходство ряда прочих падежных оформителей; с северной — главным образом форма исходного падежа и наличие совместного падежа.\n\nИмя прилагательное орокского языка имеет много сходных черт с той же категорией в языках ульчском и нанайском. Это сказывается не только в общей этим трем языкам бедности словообразовательными элементами категории прилагательных, но также и в звуковой близости имеющихся оформителей.\n\nКроме того, в противоположность языкам северной группы в языках ульчском, нанайском и орокском сравнительно широко применяется для обозначения признаков предмета сочетание, состоящее из наречия и глагола би (кок-кок би 'твердый').\n\nПо способу же согласования имен прилагательных с именами существительными язык ороков занимает промежуточное положение между языками эвенкийским и эвенским, с одной стороны, и ульчским и нанайским — с другой. Прилагательные орокского языка, как правило, не согласуются со своим определяемым словом в падеже, но согласуются в числе. Языкам северной группы — эвенкийскому и эвенскому — свойственно согласование и в числе, и в падеже, языкам ульчскому и нанайскому подобное согласование чуждо.\n\nНекоторые своеобразные черты присущи орокским числительным и местоимениям. Так, в области количественных числительных орокский язык выделяется среди прочих тунгусо-маньчжурских языков наличием для единицы особого названия гида ~ деда. Прочие отличия сводятся в значительной мере к ряду фонетических соответствий. По названию для сотни — тингу и для тысячи — минга(н) числительные орокского языка стоят в одном ряду с тунгусо-маньчжурскими языками южной группы.\n\nОтсутствие включительного местоимения объединяет орокский язык в одну группу с нанайским и ульчским.\n\nЛичные и вопросительные местоимения орокского языка типологически сходны с ульчскими. Своеобразны лишь формы личных местоимений 1-го и 2-го л. мн. ч. в винительном падеже — мунгбун, сунгбун, а также формы личных местоимений 1-го и 2-го л. ед. ч. в именительном падеже — бици, сици.\n\nВ разделе глагольных форм обращает на себя внимание тот факт, что ряд глагольных образований имеет своей основой форму активного причастия настоящего времени, что имеет место и в нанайском языке (формы настоящего и прошедшего времени изъявительного наклонения), а также в ульчском (формы настоящего, прошедшего и будущего времени изъявительного наклонения). В орокском же языке, кроме тех форм изъявительного наклонения, которые отмечены для ульчского языка, от указанной причастий образуются также формы сослагательного наклонения и повелительная форма 1-го л. ед. ч."}]}]
@tkcoding commented on GitHub (Jul 17, 2024): @JianXiao2021 @PhySci If you are facing this issue, you can add in `gpt4o_mode=True' . parser = LlamaParse(gpt4o_mode=True,verbose=True) with gpt4o_mode it basically can recognise the language by themselves. this is the output I got: ``` [{'page': 1, 'md': "падежа (дезигнатив) со сходным суффиксом, а также звуковое сходство ряда прочих падежных оформителей; с северной — главным образом форма исходного падежа и наличие совместного падежа.\n\nИмя прилагательное орокского языка имеет много сходных черт с той же категорией в языках ульчском и нанайском. Это сказывается не только в общей этим трем языкам бедности словообразовательными элементами категории прилагательных, но также и в звуковой близости имеющихся оформителей.\n\nКроме того, в противоположность языкам северной группы в языках ульчском, нанайском и орокском сравнительно широко применяется для обозначения признаков предмета сочетание, состоящее из наречия и глагола би (кок-кок би 'твердый').\n\nПо способу же согласования имен прилагательных с именами существительными язык ороков занимает промежуточное положение между языками эвенкийским и эвенским, с одной стороны, и ульчским и нанайским — с другой. Прилагательные орокского языка, как правило, не согласуются со своим определяемым словом в падеже, но согласуются в числе. Языкам северной группы — эвенкийскому и эвенскому — свойственно согласование и в числе, и в падеже, языкам ульчскому и нанайскому подобное согласование чуждо.\n\nНекоторые своеобразные черты присущи орокским числительным и местоимениям. Так, в области количественных числительных орокский язык выделяется среди прочих тунгусо-маньчжурских языков наличием для единицы особого названия гида ~ деда. Прочие отличия сводятся в значительной мере к ряду фонетических соответствий. По названию для сотни — тингу и для тысячи — минга(н) числительные орокского языка стоят в одном ряду с тунгусо-маньчжурскими языками южной группы.\n\nОтсутствие включительного местоимения объединяет орокский язык в одну группу с нанайским и ульчским.\n\nЛичные и вопросительные местоимения орокского языка типологически сходны с ульчскими. Своеобразны лишь формы личных местоимений 1-го и 2-го л. мн. ч. в винительном падеже — мунгбун, сунгбун, а также формы личных местоимений 1-го и 2-го л. ед. ч. в именительном падеже — бици, сици.\n\nВ разделе глагольных форм обращает на себя внимание тот факт, что ряд глагольных образований имеет своей основой форму активного причастия настоящего времени, что имеет место и в нанайском языке (формы настоящего и прошедшего времени изъявительного наклонения), а также в ульчском (формы настоящего, прошедшего и будущего времени изъявительного наклонения). В орокском же языке, кроме тех форм изъявительного наклонения, которые отмечены для ульчского языка, от указанной причастий образуются также формы сослагательного наклонения и повелительная форма 1-го л. ед. ч.", 'images': [{'name': 'page.jpg', 'height': 0, 'width': 0, 'x': 0, 'y': 0}], 'items': [{'type': 'text', 'value': "падежа (дезигнатив) со сходным суффиксом, а также звуковое сходство ряда прочих падежных оформителей; с северной — главным образом форма исходного падежа и наличие совместного падежа.\n\nИмя прилагательное орокского языка имеет много сходных черт с той же категорией в языках ульчском и нанайском. Это сказывается не только в общей этим трем языкам бедности словообразовательными элементами категории прилагательных, но также и в звуковой близости имеющихся оформителей.\n\nКроме того, в противоположность языкам северной группы в языках ульчском, нанайском и орокском сравнительно широко применяется для обозначения признаков предмета сочетание, состоящее из наречия и глагола би (кок-кок би 'твердый').\n\nПо способу же согласования имен прилагательных с именами существительными язык ороков занимает промежуточное положение между языками эвенкийским и эвенским, с одной стороны, и ульчским и нанайским — с другой. Прилагательные орокского языка, как правило, не согласуются со своим определяемым словом в падеже, но согласуются в числе. Языкам северной группы — эвенкийскому и эвенскому — свойственно согласование и в числе, и в падеже, языкам ульчскому и нанайскому подобное согласование чуждо.\n\nНекоторые своеобразные черты присущи орокским числительным и местоимениям. Так, в области количественных числительных орокский язык выделяется среди прочих тунгусо-маньчжурских языков наличием для единицы особого названия гида ~ деда. Прочие отличия сводятся в значительной мере к ряду фонетических соответствий. По названию для сотни — тингу и для тысячи — минга(н) числительные орокского языка стоят в одном ряду с тунгусо-маньчжурскими языками южной группы.\n\nОтсутствие включительного местоимения объединяет орокский язык в одну группу с нанайским и ульчским.\n\nЛичные и вопросительные местоимения орокского языка типологически сходны с ульчскими. Своеобразны лишь формы личных местоимений 1-го и 2-го л. мн. ч. в винительном падеже — мунгбун, сунгбун, а также формы личных местоимений 1-го и 2-го л. ед. ч. в именительном падеже — бици, сици.\n\nВ разделе глагольных форм обращает на себя внимание тот факт, что ряд глагольных образований имеет своей основой форму активного причастия настоящего времени, что имеет место и в нанайском языке (формы настоящего и прошедшего времени изъявительного наклонения), а также в ульчском (формы настоящего, прошедшего и будущего времени изъявительного наклонения). В орокском же языке, кроме тех форм изъявительного наклонения, которые отмечены для ульчского языка, от указанной причастий образуются также формы сослагательного наклонения и повелительная форма 1-го л. ед. ч.", 'md': "падежа (дезигнатив) со сходным суффиксом, а также звуковое сходство ряда прочих падежных оформителей; с северной — главным образом форма исходного падежа и наличие совместного падежа.\n\nИмя прилагательное орокского языка имеет много сходных черт с той же категорией в языках ульчском и нанайском. Это сказывается не только в общей этим трем языкам бедности словообразовательными элементами категории прилагательных, но также и в звуковой близости имеющихся оформителей.\n\nКроме того, в противоположность языкам северной группы в языках ульчском, нанайском и орокском сравнительно широко применяется для обозначения признаков предмета сочетание, состоящее из наречия и глагола би (кок-кок би 'твердый').\n\nПо способу же согласования имен прилагательных с именами существительными язык ороков занимает промежуточное положение между языками эвенкийским и эвенским, с одной стороны, и ульчским и нанайским — с другой. Прилагательные орокского языка, как правило, не согласуются со своим определяемым словом в падеже, но согласуются в числе. Языкам северной группы — эвенкийскому и эвенскому — свойственно согласование и в числе, и в падеже, языкам ульчскому и нанайскому подобное согласование чуждо.\n\nНекоторые своеобразные черты присущи орокским числительным и местоимениям. Так, в области количественных числительных орокский язык выделяется среди прочих тунгусо-маньчжурских языков наличием для единицы особого названия гида ~ деда. Прочие отличия сводятся в значительной мере к ряду фонетических соответствий. По названию для сотни — тингу и для тысячи — минга(н) числительные орокского языка стоят в одном ряду с тунгусо-маньчжурскими языками южной группы.\n\nОтсутствие включительного местоимения объединяет орокский язык в одну группу с нанайским и ульчским.\n\nЛичные и вопросительные местоимения орокского языка типологически сходны с ульчскими. Своеобразны лишь формы личных местоимений 1-го и 2-го л. мн. ч. в винительном падеже — мунгбун, сунгбун, а также формы личных местоимений 1-го и 2-го л. ед. ч. в именительном падеже — бици, сици.\n\nВ разделе глагольных форм обращает на себя внимание тот факт, что ряд глагольных образований имеет своей основой форму активного причастия настоящего времени, что имеет место и в нанайском языке (формы настоящего и прошедшего времени изъявительного наклонения), а также в ульчском (формы настоящего, прошедшего и будущего времени изъявительного наклонения). В орокском же языке, кроме тех форм изъявительного наклонения, которые отмечены для ульчского языка, от указанной причастий образуются также формы сослагательного наклонения и повелительная форма 1-го л. ед. ч."}]}] ```
Sign in to join this conversation.
1 Participants
Notifications
Due Date
No due date set.
Dependencies

No dependencies set.

Reference: run-llama/llama_cloud_services#167