Skip to content

处理长文本的问题 #364

@UknowSth

Description

@UknowSth

在预处理阶段过长的文本是如何处理的呢,是直接截断了吗。目前想要做一个阅读理解的任务,但是需要针对自己的语料库进行增量预训练,语料库文档长度大多超过500,这是需要将文档分成子句再去做预处理比较好吗。

Metadata

Metadata

Assignees

No one assigned

    Labels

    No labels
    No labels

    Type

    No type

    Projects

    No projects

    Milestone

    No milestone

    Relationships

    None yet

    Development

    No branches or pull requests

    Issue actions