面向机器学习的自然语言标注2.2 背景研究-低调大师

面向机器学习的自然语言标注2.2 背景研究

2017-05-01 674

2.2 背景研究

既然你已经考虑了哪些语言学层次适合标注任务，那么可以对相关研究工作进行了解。虽然建立标注语料库要花费许多工夫，完全由自己单独地完成一个好的标注任务也是可能的，但是首先了解业界的相关研究与发展现状将可以节省大量的时间和精力。很可能已有的一些研究与你正在进行的工作有关，从而使你不必一切从头做起。

例如，如果对时间标注感兴趣，现在ISO-TimeML已成为时间与事件标注方面（包括时间关系）的国际标准化组织标准。这一事实并不要求所有的时间标注都必须原样不动地使用ISO-TimeML的标注方案。在诸如医学和生物医学文本分析的领域中，TimeML可作为有用的起点，但是在有些情况下它给标注人员提供了太多的选项，在另一些情况下则没有覆盖与所在领域相关的一些特殊用例。了解其他人在已有的标注方案中进行的工作，特别是与你的标注计划直接相关

微信关注我们

原文链接：https://yq.aliyun.com/articles/82386

转载内容版权归作者及来源网站所有！

低调大师中文资讯倾力打造互联网数据资讯、行业资源、电子商务、移动互联网、网络营销平台。持续更新报道IT业界、互联网、市场资讯、驱动更新,是最及时权威的产业资讯及硬件资讯报道平台。

面向机器学习的自然语言标注1.3 语言数据和机器学习

1.3 语言数据和机器学习我们已经介绍了语言标注方法及其语言数据标注格式的例子，接下来将描述基于这些标注语料库的计算框架，即机器学习。机器学习是人工智能的一个分支，研究如何根据经验和已有数据学习和改善性能的算法。它们学习（或生成）一个函数，将具体的输入数据映射为想要的输出。就我们的目标而言，机器学习算法处理的“数据”是自然语言，最常见的格式是文本，更典型的是标注突显具体特征的标签，这些特征与学习任务相关。正如我们将要看到的，前面所讨论的标注为机器学习流程（训练阶段）提供了丰富的输入数据。当在自然语言处理中使用标注数据集进行工作时，通常有3种类型的ML算法：监督学习监督学习是指任何通过生成一个函数将输入映射到一个预先设定的标签集合（想要的输出）的技术。标签通常是元数据标签，由人通过标注语料库的方式提供，其目的是用于机器学习中的训练过

2017-05-01

716

本节书摘来异步社区《Python自然语言处理》一书中的第1章，作者：【美】Steven Bird , Ewan Klein , Edward Loper，更多章节内容可以访问云栖社区“异步社区”公众号查看第1章　语言处理与Python Python自然语言处理我们能够很容易地得到数百万数量级的文本。假设我们会写一些简单的程序，那可以用它来做些什么？本章将解决以下几个问题。（1）通过将技术性较简单的程序与大规模文本结合起来，我们能实现什么？（2）如何自动地提取出关键字和词组，用来总结文本的风格和内容？（3）Python编程语言为上述工作提供了哪些工具和技术？（4）自然语言处理中有哪些有趣的挑战呢？本章分为风格完全不同的两部分。在1.1节，我们将进行一些与语言相关的编程练习而不去解释它们是如何实现的。在1.2节，我们将系统地回顾关键的编程概念。我们使用章节标题来区分这两种风格，而后面几章则不像前面一样，是将两种风格混合在一起，不作明显的区分。我们希望这种介绍风格能使你对将要出现的内容有一个真实的体会，与此同时，介绍中还涵盖了语言学与计算机科学的基本概念。如果你对这两个方面已经有...

2017-05-01

700

资源下载

更多资源

Mario

马里奥是站在游戏界顶峰的超人气多面角色。马里奥靠吃蘑菇成长，特征是大鼻子、头戴帽子、身穿背带裤，还留着胡子。与他的双胞胎兄弟路易基一起，长年担任任天堂的招牌角色。

腾讯云软件源

为解决软件依赖安装时官方源访问速度慢的问题，腾讯云为一些软件搭建了缓存服务。您可以通过使用腾讯云软件源站来提升依赖包的安装速度。为了方便用户自由搭建服务架构，目前腾讯云软件源站支持公网访问和内网访问。

Nacos

Nacos /nɑ:kəʊs/ 是 Dynamic Naming and Configuration Service 的首字母简称，一个易于构建 AI Agent 应用的动态服务发现、配置管理和AI智能体管理平台。Nacos 致力于帮助您发现、配置和管理微服务及AI智能体应用。Nacos 提供了一组简单易用的特性集，帮助您快速实现动态服务发现、服务配置、服务元数据、流量管理。Nacos 帮助您更敏捷和容易地构建、交付和管理微服务平台。

Rocky Linux

Rocky Linux（中文名：洛基）是由Gregory Kurtzer于2020年12月发起的企业级Linux发行版，作为CentOS稳定版停止维护后与RHEL（Red Hat Enterprise Linux）完全兼容的开源替代方案，由社区拥有并管理，支持x86_64、aarch64等架构。其通过重新编译RHEL源代码提供长期稳定性，采用模块化包装和SELinux安全架构，默认包含GNOME桌面环境及XFS文件系统，支持十年生命周期更新。