การถอดคำแบบถ่ายเสียงสำหรับชื่อบุคคลภาษาไทยที่เขียนด้วยอักษรโรมัน

View Dataset
ชุลีกร กิตติกูล

Description

การถอดคำแบบถ่ายเสียงสำหรับแต่ละคำสามารถสร้างได้จากกฎ หรือใช้แบบจำลองทางสถิติ หรือค้นจากพจนานุกรม อย่างไรก็ตามการขาดมาตรฐานและความหลายหลากของการแปลงชื่อบุคคลไทยให้เป็นชื่อที่เขียนด้วยอักษรโรมันเป็นงานที่ท้าทาย และแม้ว่าวิธีที่ใช้พจนานุกรมเหมือนจะให้ผลที่ค่อนข้างถูกต้องที่สุด แต่ส่วนของการแปลงตัวอักษรเป็นเสียงก็ยังมีความจำเป็นสำหรับคำที่ไม่พบในพจนานุกรม งานวิจัยนี้เสนอวิธีการถอดคำแบบถ่ายเสียงสำหรับชื่อบุคคลภาษาไทยที่เขียนด้วยอักษรโรมันให้เป็นเสียงภาษาไทย โดยคำนึงถึงความนิยมในการใช้งาน ชื่อบุคคลภาษาไทยที่เขียนด้วยอักษรโรมันจะถูกแบ่งให้เป็นสายลำดับของแกรมโดยใช้พจนานุกรมแกรมสะสมซึ่งถูกสร้างจากชื่อมากกว่า 130,000 ชื่อ ผลการศึกษาพบว่าวิธีนี้ให้ความถูกต้องของผลลัพธ์ที่ 93 % และ 95 % โดยวัดจากคะแนนความเห็นของการยอมรับได้ เมื่อคำที่ถอดคำแบบถ่ายเสียงถูกสร้างจากสายลำดับที่เป็นไปได้ทั้งหมด ด้วยการไม่ถ่วงน้ำหนักแกรมภาษาไทย และด้วยการถ่วงน้ำหนักแกรมภาษาไทยตามลำดับ และเมื่อใช้การจับคู่คำแบบยาวที่สุด จะได้ความถูกต้องที่ 73% และ 77% เมื่อใช้การไม่ถ่วงน้ำหนักแกรมภาษาไทยและการถ่วงน้ำหนักแกรมภาษาไทยตามลำดับ

Citations (0)

Mentions (0)

Metrics

Dataset Index

0.1

FAIR Score

15%

Citations

0

Mentions

0

Metrics Over Time

Publication Details

DOI

Publisher

จุฬาลงกรณ์มหาวิทยาลัย

Assigned Domain

Subfield

Plant Science

Field

Agricultural and Biological Sciences

Domain

Life Sciences

Confidence Score

58%

Source

Open Alex

Keywords

ภาษาไทย -- การถอดตัวอักษร

Normalization Factors

FT

65.38

CTw

1.00

MTw

1.00