A Simple but Tough-to-Beat Baseline for Sentence Embeddings阅读笔记

概述

一篇17年的论文, 采用无监督的方法.
主要思想可以概括为两步:

  • 利用词嵌入方法,通过词向量的线性的加权组合对一个句子进行编码
  • 利用奇异向量求出最终的句向量。

算法

实验

1. Textual Similarity Tasks

数据集

  • all the datasets from SemEval semantic textual similarity (STS) tasks (2012-2015)
  • the SemEval 2015 Twitter task
  • the SemEval 2014 Semantic Relatedness task

实验设置
词向量分别采用了无监督的GloVe和弱监督的PSL.
α \alpha α固定为 1 0 3 10^{-3} 103, 词频利用commoncrawl dataset进行统计.

实验结果

2. Supervised Tasks

  • the SICK similarity task
  • the SICK entailment task
  • the Stanford Sentiment Treebank (SST) binary classification task

实验结果

全部评论

相关推荐

04-30 21:35
已编辑
长安大学 C++
晓沐咕咕咕:评论区没被女朋友好好对待过的计小将可真多。觉得可惜可以理解,毕竟一线大厂sp。但是骂楼主糊涂的大可不必,说什么会被社会毒打更是丢人。女朋友体制内生活有保障,读研女朋友还供着,都准备订婚了人家两情相悦,二线本地以后两口子日子美滋滋,哪轮到你一个一线城市房子都买不起的996清高计小将在这说人家傻😅
点赞 评论 收藏
分享
醉蟀:你是我今年见过的最美牛客女孩
点赞 评论 收藏
分享
评论
点赞
收藏
分享

创作者周榜

更多
牛客网
牛客企业服务