利用艺术家的整数ID映射将标签转换为向量
2024-08-31 09:31:35
<strong><span style="font-size:18px;">/***
* @author YangXin
* @info Mapper选择艺术家的整数特征ID然后建立单个特征的向量。这些一维的部分
* 向量会传给Reducer,后者会将这些向量简单地进行联结。生成一个完整的向量。 */
package unitTwelve; import java.io.IOException;
import java.util.HashMap;
import java.util.Map;
import java.util.regex.Pattern;
import org.apache.hadoop.conf.Configuration;
import org.apache.hadoop.io.DefaultStringifier;
import org.apache.hadoop.io.LongWritable;
import org.apache.hadoop.io.Text;
import org.apache.hadoop.mapreduce.Mapper;
import org.apache.hadoop.util.GenericsUtil;
import org.apache.mahout.math.NamedVector;
import org.apache.mahout.math.SequentialAccessSparseVector;
import org.apache.mahout.math.VectorWritable; public class VectorMapper extends Mapper<LongWritable, Text, Text, VectorWritable>{
private Pattern splitter;
private VectorWritable writer;
private Map<String, Integer> dictionary = new HashMap<String, Integer>(); @Override
protected void map(LongWritable key, Text value, Context context) throws IOException, InterruptedException{
String[] fields = splitter.split(value.toString());
if(fields.length < 4){
context.getCounter("Map", "LinesWithErrors").increment(1);
return;
}
String arrtist = fields[1];
String tag = fields[2];
double weight = Double.parseDouble(fields[3]);
NamedVector vector = new NamedVector(new SequentialAccessSparseVector(dictionary.size()), tag);
vector.set(dictionary.get(value), weight);
writer.set(vector);
context.write(new Text(tag), writer);
} @Override
protected void setup(Context context) throws IOException, InterruptedException{
super.setup(context);
Configuration conf = context.getConfiguration();
DefaultStringifier<Map<String, Integer>> mapStringifier = new DefaultStringifier<Map<String, Integer>>(conf, GenericsUtil.getClass(dictionary));
dictionary = mapStringifier.fromString(conf.get("dictionary"));
splitter = Pattern.compile("<sep>");
writer = new VectorWritable();
}
}
</span></strong>
最新文章
- textview 弹出键盘上面添加完成按钮,并设置输入内容的格式。
- (转)ElasticSearch学习
- 梳理javascript原型整体思路
- XAF响应式布局皮肤界面展示
- php mysql 中文乱码解决方法
- HDOJ1518Square 深搜
- c++ primer plus 习题答案(6)
- weblogic配置修改java代码后不需要重启热部署方式
- sql server 2012提示评估期已过的解决办法 附序列号
- Spring详解(五)------AOP
- 阿狸V任务页面爬取数据解析
- 在本机使用虚拟机安装一个linux系统,并搭建ftp服务器
- A1113. Integer Set Partition
- Git 和 Repo常用命令
- unity中实现三个Logo图片进行若隐若现的切换并有延时切换图片的效果
- Flask源码阅读-第一篇(flask包下的__main__.py)
- MapGIS10.3新功能
- (转)【Unity Shaders】Vertex Magic —— 访问顶点颜色
- C#的Lambda 表达式都使用 Lambda 运算符 =>;,该运算符读为“goes to”。语法如下:
- 一、用Delphi10.3模拟读取百度网页,并读取相关头部信息
热门文章
- pytorch 5 classification 分类
- [LeetCode] 350. 两个数组的交集 II intersection-of-two-arrays-ii(排序)
- WinServer-PowerShell基础
- 电子签章盖章之jQuery插件jquery.zsign
- Spoj 1557 Can you answer these queries II 线段树 随意区间最大子段和 不反复数字
- [LeetCOde][Java] Best Time to Buy and Sell Stock III
- UVALive 4192/HDU 2959 Close Enough Computations 数学
- C++ 虚函数的缺省參数问题
- rails数据库操作rake db一点心得
- Laravel-redis-订阅发布