一 前言

Word2Vec是同上一篇提及的PageRank一样,都是Google的工程师和机器学习专家所提出的的;在学习这些算法、模型的时候,最好优先去看Google提出者的原汁Paper和Project,那样带来的启发将更大。因为创造者对自己所创之物的了解程度优于这世上的绝大部分者,这句话,针对的是爱看博文的读者,like me。
另外,补充几句。
1.防止又被抄袭,故关键笔记以图贴之。
2.标题前带阿拉伯数字标号的内容,便是使用Gensim的Word2Vec模型过程中的完整流程序号,通常也较为常用且重要。

二 鸣谢

感谢如下文章/论文的详细描述,它们亦是本文的主要测试依据,尤其需要感谢最后四篇博文的精彩解说。

三 Word2Vec 概要

重要API/类

  • gensim.models.KeyedVectors
  • gensim.models.word2vec
    • gensim.models.word2vec.Word2Vec(sentences,min_count,size,worker)
  • gensim.models.Word2Vec(sentences,min_count,size,worker)

Word2Vec类:构建Word2Vec词向量模型

四 Word2Vec 详解

  • 注:标题前带阿拉伯数字标号的内容,便是使用Gensim的Word2Vec模型过程中的完整流程序号,通常也较为常用且重要。

1 加载语料库

2 (初次)训练

手动构建词汇表

3 追加训练(更新模型)

4 存储模型

5 加载模型

6 获取词向量

加载词向量

7 模型应用

8 模型评估

五 补充

  • 欢迎探讨,欢迎Follow~

最新文章

  1. logging 文件日志
  2. 《C#编程宝典:十年典藏版》阅读笔记(1)
  3. 多线程(pthread、NSThread、GCD)
  4. [POJ1157]LITTLE SHOP OF FLOWERS
  5. Mac下如何显示隐藏文件/文件夹_百度经验
  6. 一个 XSD 实例
  7. django查询常用操作符及models和admin的写法
  8. 走FILTER效率高的2种情况
  9. Sass使用教程
  10. python version 2. required,which was not found in the registry 解决方案
  11. java.lang.ClassNotFoundException: org.apache.log4j.Logger 异常
  12. 自学python 6.
  13. redis数据操作笔记
  14. js---根据指定的顺序进行排序
  15. 自动提取文件系统---binwalk(一)
  16. [Spring学习笔记 5 ] Spring AOP 详解1
  17. 国际化实现之基于jquery
  18. Linux之服务器介绍
  19. 一步一步学习Android开发
  20. JavaScript 之 ajax

热门文章

  1. 【转载】softmax的log似然代价函数(求导过程)
  2. Summer training #8
  3. Django:报错 raise MigrationSchemaMissing("Unable to create the django_migrations table (%s)" % exc)
  4. JavaScript入门学习之二——函数
  5. CSS基础学习-11.CSS伸缩盒(新版本)
  6. HTTPClick调用WebApi帮助类
  7. top命令经常用来监控linux的系统状况,比如cpu、内存的使用,程序员基本都知道这个命令。 按 q 退出
  8. laravel中遇到的坑
  9. C#与数据库有关的控件和属性
  10. BZOJ 3060: [Poi2012]Tour de Byteotia 并查集