
选自towardsdatascience
作者:Raimi Karim
机器之心编译
参加:王子嘉、Geek AI
言语建模和文本生成是当下自然言语处理范畴十分炽热的两个研讨课题。而早在百年曾经,科学大师马尔科夫和香农就对此进行了开端的探究......
1913 年,俄国数学家安德烈·安德烈耶维奇·马尔科夫(Andrey Andreyevich Markov)坐在他圣彼得堡的书房里,手里拿着其时的文学巨作——普希金(Alexander Pushkin)在 19 世纪创造的诗篇小说《尤金·奥涅金》(Eugene Onegin)。
可是马尔科夫并没有真的在读这篇闻名的文章,而是拿起了一支笔和一张草稿纸,去掉了这本书的前 2 万个字母中所有的标点符号和空格,记成了一长串字母。然后,他又把这些字母放进了 200 个网格中(每个网格有 10×10 个字符),并对每行每列中元音的数量进行计算,然后将这些成果进行了收拾。
关于不知情的旁观者来说,马尔科夫的举动略显怪异。为什么有人会以这种办法解构一部文学天才的著作,而且是解构成这种无法被了解的办法?
事实是,马尔科夫读这本书并不是为了学习与日子和人道有关的常识,他是在寻觅文本中更根本的数学结构。
之所以要别离元音和子音,是由于马尔科夫正在测验他从 1909 年就一向在研讨的概率论研讨(https://www.americanscientist.org/article/first-links-in-the-markov-chain)。
在那之前,概率范畴的研讨大多局限于剖析像轮盘赌或抛硬币这样的现象,在这些研讨中从前工作的成果不会改动当时工作的概率。但马尔科夫以为,大多数工作的发作都是有一连串的因果关系的,而且依赖于之前的成果。他想要找到经过概率化的剖析对这些工作进行建模的办法。
马尔科夫以为,言语便是这种体系的一个比如:曩昔呈现的字符在某些特定的程度上决议了现在的成果。为了承认这一点,他想证明在普希金小说这样的文本中,某个字母在文本中呈现的几率在某种程度上是取决于之前呈现的字母的。
因而才呈现了本文开端马尔科夫计算「尤金·奥涅金」中元音的那一幕。经过这次计算,他发现 43% 的字母是元音,57% 是子音。然后马尔科夫将这 2 万个字母分红元音和子音组合:他发现有 1,104 对「元音-元音」,3,827 对「子音-子音」,15,069 对「元音-子音」和「子音-元音」组合。从计算学上讲,这标明普希金的文本中任何一个字母,如果是元音,下一个字母很或许是子音,反之亦然。
马尔科夫用这个剖析证明了普希金笔下的「尤金·奥涅金」不仅仅是字母的随机散布,还存在一些潜在的能够建模的计算特性。依据这份研讨产出的深邃论文「An Example of Statistical Investigation of the Text Eugene onegin Concerning the Connection of Samples in Chains」在马尔科夫生前并没有被广泛引证,而且直到 2006 年才被翻译成英语。
但它的一些关于概率和言语的中心概念已经在全球范围内传达开来,并终究在克劳德·香农(Claude Shannon)1948 年宣布的极具影响力的论文「A Mathematical Theory of Communication」中发现了对这些思维的重述。
马尔科夫论文:
https://www.cambridge.org/core/journals/science-in-context/article/an-example-of-statistical-investigation-of-the-text-eugene-onegin-concerning-the-connection-of-samples-in-chains/EA1E005FA0BC4522399A4E9DA0304862
香农论文:http://www.math.harvard.edu/~ctm/home/text/others/shannon/entropy/entropy.pdf
香农(Shannon)的论文概述了一种准确丈量音讯中信息量的办法,从而为界说数字年代的信息论奠定了根底。香农深深地被马尔科夫的观念所招引:即在给定的文本中,能够估量出呈现某个字母或单词的或许性。和马尔科夫相同,香农经过一些文本试验证明了这一点,这些文本试验除了树立言语的计算模型外,还尝试了运用该模型依据这些计算规矩生成文本。
在开端的操控试验中,他先从包括 27 个符号的字母表(26 个字母,加上一个空格)中随机抽取字母以生成语句,并取得以下输出:
XFOML RXKHRJFFJUJ ZLPWCFWKCYJ FFJEYVKCQSGHYD QPAAMKBZAACIBZLHJQD
香农说,这句话是毫无意义的噪声,由于当咱们沟通时,咱们不会以相同的概率选取字母。正如马尔可夫所证明的,子音比元音更有或许呈现。可是在更高的粒度级别上,E 比 S 更为常见,S 比 Q 更为常见。为了处理这样的一个问题,Shannon 修改了他的原始字母表,使得这个模型更准确地对英语的概率进行建模——他从字母表中提取出 E 的或许性比 Q 的或许性高 11%。当他再次从经过从头校准的语料库中随机抽取字母时,生成的语句开端跟英语有点接近了:
OCRO HLI RGWR NMIELWIS EU LL NBNESEBYA THEI EEI ALHENHTTPA OOBTTVA NAH BRL。
在随后的一系列试验中,香农证明了,当你把计算模型变得更杂乱时,你得到的成果会渐渐的简单了解。香农经过马尔可夫的理念提醒了英语的计算结构,并标明经过对该结构建模(经过剖析字母和单词彼此组合呈现的相关概率),这些模型能够生成实在意义上的言语。
给定文本的计算模型越杂乱,言语生成就越准确——或如香农所说,「与一般英语文本的相似性」越大。在最终的试验中,香农从语料库中提取单词,而不是字母,并得到如下成果:
THE HEAD AND IN FRonTAL ATTACK ON AN ENGLISH WRITER THAT THE CHARACTER OF THIS POINT IS THEREFORE ANOTHER METHOD FOR THE LETTERS THAT THE TIME OF WHO EVER TOLD THE PROBLEM FOR AN UNEXPECTED.
关于香农和马尔科夫来说,「言语的计算特性能够被建模」这个观念为他们从头考虑他们正在研讨的更广泛的问题供给了一个思路。
关于马尔科夫来说,它将随机性的研讨扩展到彼此独立的工作之外,为概率论的新年代铺平了路途。对香农来说,这协助他发现了一种准确的丈量办法以及编码音讯中的信息单元,这个发现彻底改动了电子信息以及现在的数字通信职业。他们在言语建模和生成方面的计算办法也创始了自然言语处理的新年代,这一年代一向延续到今日。
第三届机器之心「Synced Machine Intelligence Awards」年度奖项评选正在进行中。本次评选设置六大奖项,侧重重视人工智能公司的产品、使用事例和工业落地状况,根据实在客观的工业体现筛选出最值得重视的企业,为职业带来实践的参考价值。
参选报名日期:2019 年 10 月 23 日~2019 年 12 月 15 日
评定期:2019 年 12 月 16 日~2019 年 12 月 31 日
奖项发布:2020 年 1 月












