Chuyển đến nội dung chính

Vietnamese treebank construction and entropy-based error detection

 http://repository.vnu.edu.vn/handle/VNU_123/28373
Treebanks, especially the Penn treebank for natural language processing (NLP) in English, play an essential role in both research into and the application of NLP.
\


However, many languages still lack treebanks and building a treebank can be very complicated and difficult.
This work has a twofold objective.
Firstly, to share our results in constructing a large Vietnamese treebank (VTB) with three levels of annotation including word segmentation, part-of-speech tagging, and syntactic analysis.
Major steps in the treebank construction process are described with particular regard to specific Vietnamese properties such as lack of word delimiter and isolation.
Those properties make sentences highly syntactically ambiguous, and therefore it is difficult to ensure a high level of agreement among annotators.
Various studies of Vietnamese syntax were employed not only to define annotations but also to systematically deal with ambiguities.

Title: Vietnamese treebank construction and entropy-based error detection
Authors: Nguyen, Phuong-Thai
Le, Anh-Cuong
Ho, Tu-Bao
Keywords: Treebank
Error detection
Entropy
Issue Date: 2015
Publisher: Đại học Quốc gia Hà Nội
Citation: ISIKNOWLEDGE
Abstract: Treebanks, especially the Penn treebank for natural language processing (NLP) in English, play an essential role in both research into and the application of NLP. However, many languages still lack treebanks and building a treebank can be very complicated and difficult. This work has a twofold objective. Firstly, to share our results in constructing a large Vietnamese treebank (VTB) with three levels of annotation including word segmentation, part-of-speech tagging, and syntactic analysis. Major steps in the treebank construction process are described with particular regard to specific Vietnamese properties such as lack of word delimiter and isolation. Those properties make sentences highly syntactically ambiguous, and therefore it is difficult to ensure a high level of agreement among annotators. Various studies of Vietnamese syntax were employed not only to define annotations but also to systematically deal with ambiguities.
Description: LANGUAGE RESOURCES AND EVALUATION Volume: 49 Issue: 3 Pages: 487-519 Published: SEP 2015 ; TNS05625
URI: http://repository.vnu.edu.vn/handle/VNU_123/28373
Appears in Collections:Bài báo của ĐHQGHN trong Web of Science

Nhận xét

Bài đăng phổ biến từ blog này

Xây dựng nền văn hóa trong kháng chiến chống Pháp (1945-1954)

Mời các bạn quan tâm tìm hiểu luận văn “Xây dựng nền văn hóa trong kháng chiến chống Pháp (1945-1954)” của tác giả Hoàng Thị Hồng Nga tại đường link http://repository.vnu.edu.vn/handle/VNU_123/19976 Luận văn bao gồm các nội dung sau - Tái hiện lại những yếu tố bối cảnh quốc tế (ảnh hưởng từ Liên Xô, Trung Quốc) và trong nước (đời sống kháng chiến, đời sống văn hóa) tới quá trình xây dựng lý luận của nền văn hóa mới: văn hóa dân chủ nhân dân trong thời kỳ đất nước có chiến tranh.  - Phân tích và làm sáng rõ những thành tựu nổi bật của các ngành, các lĩnh vực của nền văn hóa mới trong kháng chiến như: tiếp tục xây dựng lý luận của nền văn hóa kháng chiến trên nền tảng cơ bản của Bản “Đề cương văn hóa Việt Nam” (1943) (2/9/1945 - 7/1948); từng bước phát triển lý luận văn hóa, phục vụ kháng chiến – kiến quốc (7/1948 - 1954); xây dựng thiết chế văn hóa trong các lĩnh vực. Từ đó, khẳng định được những đóng góp to lớn của Đảng, cũng như giới văn hóa, nghệ sĩ trong v...

Thác triển khai toán tử ngẫu nhiên trong không gian banach khả ly

http://repository.vnu.edu.vn/handle/VNU_123/36998 Keywords Xác suất, Thống kê toán học, Toán tử ngẫu nhiên, Không gian Banach Citation Trần, M. C. (2011). Thác triển khai toán tử ngẫu nhiên trong không gian banach khả ly. Luận án Tiến sỹ, Đại học Quốc gia Hà Nội, Việt Nam Publisher Trường Đại học Khoa học Tự nhiên Appears in Collections: HUS - Dissertations

Một số phương pháp kết hợp giải bài toán chấp nhận lồi suy rộng

http://repository.vnu.edu.vn/handle/VNU_123/37115  Citation Đặng, V. H. (2016). Một số phương pháp kết hợp giải bài toán chấp nhận lồi suy rộng. Luận án Tiến sỹ, Đại học Quốc gia Hà Nội, Việt Nam Publisher Trường Đại học Khoa học Tự nhiên Appears in Collections: HUS - Dissertations