手机浏览器扫描二维码访问
凌志听着客户的需求,也不时提出一些疑问。回答完之后根据数据量给出了一个报价以及预期交付时间,客户并没有多砍价,就这么敲定了。
实际上计算文本相似度的方法有很多,比如统计两个文本中有没有词语同时出现,出现频率是否相近,标点符号使用频率是否一致等等。但这些统计都是表层的统计,句子语义深层次的相似度没有办法通过这种办法来计算。比如“开心”和“快乐”是同一语义,相似度为0.97,而“开心”和“伤心”则是相反语义,相似度为0.02。如果用最表层的统计方法是没办法得出上述结论的。所以在当下,深度学习方法则成为主要的学习句子深层次语义的方法。
凌志并不想糊弄客户,他想既然要做那就尽量做到最好。虽然客户在这一块并不是专业的,也并不知道计算相似度都有哪些方法,更没有去问凌志打算如何计算,但凌志依然想用深度学习方法来帮助客户准确计算每个公司的相似度。
凌志看着客户发来的每个公司的代表产品,找到了之前自己训练好的一份词向量表,先把产品名用分词工具分词,再对应到词向量表中,最终将两个公司之间的产品所对应的向量进行两两欧氏距离计算,最终一平均得到了每一对公司之间的相似度……
感觉也不复杂,但是不知不觉一天就过去了。凌志整理了一下数据,发给了客户。
“您好,相似度的计算已经搞好了,您看您还满意么?”
过了一会儿,客户回复道:
“[拱手]整理得太细致了,谢谢您。不过您是怎么计算相似度的呢?如果方便的话能不能告诉我一下,我想写进我的介绍推文里。”
“哦哦,其实也不复杂,我用的是词向量计算的,而词向量是用深度学习方法训练出来的……”
凌志仔细地打了一大段文字,大概介绍了一下原理,没有说得太细。实际上词向量的训练过程是深度神经网络根据词的上下文来推断出来的,比如说,“开心”这个词周围经常出现的词汇与“伤心”就截然不同。所以深度语义,本质上也是由他的上下文来决定的。这也是凌志大致解释给客户的内容。
至于如何根据上下文推导出词向量,上下文的范围界定到底有多广,凌志就没有细讲,讲了客户也不关心,他只会挑重点说。
“谢谢您哈,对了,其实我这边还有一大批数据需要计算相似度,您能不能教我使用代码呢?这样以后我就不用麻烦您了。”
教代码啊。凌志有些脑壳疼,倒也不是说不行,只不过教不是计算机行业的人运行代码可能会出现各种各样的小问题。但他也没有拒绝,这种需求都是常态,一般客户要了数据之后,如果想要代码,凌志都会免费给他,而且还耐心地教客户安装各种环境。
“也行,我给您发个文档,您先按里面的说明安装一下。”
凌志把以前写好的文档简单改改,发了过去。
过了一会儿。
“不好意思,我这边安装gensim包的时候报错了,……”
“哦哦,那可能是下载源的问题,……”
“这个地址斜杠后面是不是需要空格?……”
二十岁再嫁的寡妇怎么也不会想到自己还会有幸遇见良人,天可怜见,一次还给了她三个。余氏宗祠,祖训有言,三代为循,兄弟共妻。从医世家,兄弟有三,惟娶一女,倾心怜之。首-发:cloud(o18ui):...
在殷从稚眼中,穆砚礼是哥哥的朋友,是世交家族的少爷,是雷霆手段的商界新贵,是惹不起的腹黑野心家。没想到之后,她居然跟穆砚礼有了见不得光的关系。穆老爷子生日宴上,三楼的房间内,她被穆砚礼扣住腰身,紧紧按在门上。男人在身后笑的挑衅,“不想被你哥哥听见,就别出声。”...
遍战山河九万里,剑行天涯三千界。 一人独行,横断苍穹,问苍生孰为敌手?...
江湖不是千百年来,挑灯看剑的世界,却是少年成为梦想的舞台。江湖中的剑客,少年轻狂,热血满腔。江湖是浪子的归宿,一入江湖深似海,魂转梦萦回不得。一杯酒下肚,高玉成眸子散发出光芒。他的剑跟眼睛一样光...
【作者:红莲玉露】本文的情节很吸引人,从新婚娇妻小葵不侍寝,主角搞了秦岚,然后侍寝之后现问题,小男生翔翔闪亮登场,而小碧玉一般的前台文员赵佳居然也暴露了荡妇的本性。之后内容越挖越深,也让人更加欲罢不能,显然读者已经掉坑了。这时,弟弟的女友栾雨出现了,给本来就复杂的剧情更是凭添了无数变数。于是,当主角真正拿下妻子小葵的面具时,主角被深深地震撼了,同时被震撼的,还有读者。总之,娇妻小葵,是一个千人斩,用主角的话说,就是霸王兵团长。说实话,当我们现身边有个千人斩女人,有个霸王兵团长,我们会有什么感觉?佩服?鄙视?还是羡慕嫉妒恨。情节在这里达到了高潮,接下来就是寻根究底,探究小葵之所以成为霸王兵团长的原因,于是,便有了后文……...
史上最贪崇祯情节跌宕起伏、扣人心弦,是一本情节与文笔俱佳的历史军事小说,史上最贪崇祯-秋名山虫子-小说旗免费提供史上最贪崇祯最新清爽干净的文字章节在线阅读和TXT下载。...