Tóm tắt nội dung
Sản xuất tham chiếu, thường được gọi là Tạo biểu thức tham chiếu (REG) trong ngôn ngữ học tính toán, bao gồm hai nhiệm vụ riêng biệt: (1) REG một lần và (2) REG trong ngữ cảnh. REG một lần khám phá những thuộc tính nào của một tham chiếu cung cấp một mô tả duy nhất về nó. Ngược lại, REG trong ngữ cảnh yêu cầu biểu thức tham chiếu (anaphoric) nào là tối ưu tại các điểm khác nhau trong diễn ngôn. Cuốn sách này cung cấp một loạt các nghiên cứu chuyên sâu về nhiệm vụ REG trong ngữ cảnh. Nó khám phá kỹ lưỡng các khía cạnh khác nhau của nhiệm vụ như lựa chọn ngữ liệu, phương pháp tính toán, phân tích tính năng và kỹ thuật đánh giá. Nghiên cứu so sánh các ngữ liệu khác nhau làm nổi bật vai trò quan trọng của việc lựa chọn ngữ liệu trong nghiên cứu REG trong ngữ cảnh, nhấn mạnh ảnh hưởng của nó đối với tất cả các bước phát triển mô hình tiếp theo. Một phân tích thử nghiệm về các mô hình học máy dựa trên tính năng khác nhau cho thấy những mô hình có tập hợp các tính năng được thông báo về mặt ngôn ngữ ngắn gọn có thể cạnh tranh với các mô hình có nhiều tính năng hơn. Hơn nữa, công trình này làm nổi bật tầm quan trọng của các khái niệm liên quan đến đoạn văn, một lĩnh vực chưa được khám phá trong Tạo ngôn ngữ tự nhiên (NLG). Cuốn sách cung cấp đánh giá toàn diện về các cách tiếp cận khác nhau đối với nhiệm vụ REG-in-context (dựa trên quy tắc, dựa trên tính năng và đầu cuối thần kinh), và chứng minh rằng các mô hình phi thần kinh được chế tạo tốt có khả năng phù hợp hoặc vượt trội hơn hiệu suất của các mô hình REG-in-context thần kinh. Ngoài ra, cuốn sách còn đi sâu vào các thí nghiệm hậu hoc, nhằm mục đích cải thiện khả năng giải thích của cả mô hình REG-in-context thần kinh và cổ điển. Nó cũng giải quyết các chủ đề quan trọng khác, chẳng hạn như những hạn chế của số liệu đánh giá dựa trên độ chính xác và vai trò thiết yếu của đánh giá của con người trong nghiên cứu NLG.
Abstract:
Reference production, often termed Referring Expression Generation (REG) in computational linguistics, encompasses two distinct tasks: (1) one-shot REG, and (2) REG-in-context. One-shot REG explores which properties of a referent offer a unique description of it. In contrast, REG-in-context asks which (anaphoric) referring expressions are optimal at various points in discourse. This book offers a series of in-depth studies of the REG-in-context task. It thoroughly explores various aspects of the task such as corpus selection, computational methods, feature analysis, and evaluation techniques. The comparative study of different corpora highlights the pivotal role of corpus choice in REG-in-context research, emphasizing its influence on all subsequent model development steps. An experimental analysis of various feature-based machine learning models reveals that those with a concise set of linguistically-informed features can rival models with more features. Furthermore, this work highlights the importance of paragraph-related concepts, an area underexplored in Natural Language Generation (NLG). The book offers a thorough evaluation of different approaches to the REG-in-context task (rule-based, feature-based, and neural end-to-end), and demonstrates that well-crafted, non-neural models are capable of matching or surpassing the performance of neural REG-in-context models. In addition, the book delves into post-hoc experiments, aimed at improving the explainability of both neural and classical REG-in-context models. It also addresses other critical topics, such as the limitations of accuracy-based evaluation metrics and the essential role of human evaluation in NLG research.
Sử dụng ứng dụng Libol Bookworm quét QRCode này để mượn và đọc tài liệu)
(Lưu ý: Sử dụng ứng dụng Bookworm để xem đầy đủ tài liệu. Bạn đọc có thể tải Bookworm từ App Store hoặc Google play với từ khóa "Libol Bookworm”)