没有合适的资源?快使用搜索试试~ 我知道了~
VSM向量空间模型对文本的分类以及简单实现
4星 · 超过85%的资源 需积分: 45 90 下载量 69 浏览量
2012-09-04
20:13:39
上传
评论 3
收藏 4KB TXT 举报
温馨提示
试读
5页
VSM向量空间模型对文本的分类以及简单实现
资源推荐
资源详情
资源评论
VSM向量空间模型对文本的分类以及简单实现
1:对文本的分类,不管用什么高级的方法,首先还是需要建立数学模型的,这个地方就用SVM来建立,他的原理是根据文本的特征,比如一个文本有10个特征(一般来说每个特征是一个代表这个文本的关键词),那么这个文本向量大小就是10了。具体的每个值就是这个特征的权重(关于权重的计算很多种,我这个地方只用了词频来代表)。然后读入测试本文,根据该测试文本中的特征,看和样本中的特征的向量做运算,这个地方用的是求向量的夹角,用余弦值来表达,夹角大的就偏的远,否则比较近(这个地方没考虑到角度大于90°的情况)。
2:这个例子是为了我接下来做SVM用的,对于搞此类的算是个入门。我觉得这个效果要和输入的样本特征关系很大,我对同类的比如股票下不同类别来做判断,基本也可以判断出来权重。
3:java源代码如下:
package com.baseframework.sort;
import java.io.BufferedReader;
import java.io.File;
import java.io.FileNotFoundException;
import java.io.FileReader;
import java.io.IOException;
import java.util.Vector;
public class VsmMain {
public static void main(String[] args) {
VsmMain vsm = new VsmMain();
String basePath = vsm.getClass().getClassLoader().getResource("")
.toString().substring(6);
String content = vsm.getContent(basePath + "article.txt");
Vector<Vector<String>> samples = vsm.loadSample(basePath + "sort.txt");
vsm.samilarity(content, samples);
1:对文本的分类,不管用什么高级的方法,首先还是需要建立数学模型的,这个地方就用SVM来建立,他的原理是根据文本的特征,比如一个文本有10个特征(一般来说每个特征是一个代表这个文本的关键词),那么这个文本向量大小就是10了。具体的每个值就是这个特征的权重(关于权重的计算很多种,我这个地方只用了词频来代表)。然后读入测试本文,根据该测试文本中的特征,看和样本中的特征的向量做运算,这个地方用的是求向量的夹角,用余弦值来表达,夹角大的就偏的远,否则比较近(这个地方没考虑到角度大于90°的情况)。
2:这个例子是为了我接下来做SVM用的,对于搞此类的算是个入门。我觉得这个效果要和输入的样本特征关系很大,我对同类的比如股票下不同类别来做判断,基本也可以判断出来权重。
3:java源代码如下:
package com.baseframework.sort;
import java.io.BufferedReader;
import java.io.File;
import java.io.FileNotFoundException;
import java.io.FileReader;
import java.io.IOException;
import java.util.Vector;
public class VsmMain {
public static void main(String[] args) {
VsmMain vsm = new VsmMain();
String basePath = vsm.getClass().getClassLoader().getResource("")
.toString().substring(6);
String content = vsm.getContent(basePath + "article.txt");
Vector<Vector<String>> samples = vsm.loadSample(basePath + "sort.txt");
vsm.samilarity(content, samples);
资源评论
- xinyu092101122013-03-30代码不错,可惜是java的,我想找c++之类的来着,希望lz能在备注或者名称中注明一下是java程序
- 驭龙少年2014-12-22代码不错是java的
- h135092052018-03-14代码不错是java的
huxiangliang1126
- 粉丝: 0
- 资源: 4
上传资源 快速赚钱
- 我的内容管理 展开
- 我的资源 快来上传第一个资源
- 我的收益 登录查看自己的收益
- 我的积分 登录查看自己的积分
- 我的C币 登录后查看C币余额
- 我的收藏
- 我的下载
- 下载帮助
安全验证
文档复制为VIP权益,开通VIP直接复制
信息提交成功