Author Archives: laofish

琐记

今天一个人从图书馆出来的时候,确实是有点孤独,或者说,茫然的。 大学期间,虽然也有一个人看书的时候,但那时,肩上有着沉重的负担,自己要做什么,是非常明确的。 虽然说自己也不是没有目标——找份像样的工作。但这个目标太过宽泛,自己有着一颗极客的心,奈何命运使然,大概是不可能从事自己小时候一直希望从事的,制造高科技设备的工作了。虽然说金融业工资高,但是自己总是觉得没有准备好进入这个行业,虽然自己也已经考了证券从业资格证,也在准备考注册会计师。 CFA之类的证书也不是没有想法,只不过花费不菲,而自己又不能确定到底以后干什么,也就没有考这个证的计划了。 自己从来是一种悲观的心态,不认为自己有什么本事。最大的优点也就是兴趣广泛,求知欲比较强而已。属于那种文科生当中我不错,理科当中我文科不错这种半将就的状态,大概也就是这个学院的风格所在,不过人家混的挺好,只是我不知道自己该怎么混下去而已。 想踏踏实实的做点什么,可是做什么呢;认认真真学点东西,问题时,学什么对以后有用。我敢说自己绝对不是一个喜欢浪费时间的人,可是我平时看书的时候,玩手机的时间可能更多,虽然也算是信息的获取,不过获取的更多的只是一些毫无用处的噪声而已。 有时候也在想,自己干嘛总纠结学有用的东西,比如看电影,或许也是一种更好的熏陶,指不定怎么就用上了呢。就像喝酒玩牌,不也都成了社交技能了么,只是自己放不开,总想做点什么而已,或许,是上进心太强了,束缚了自己而已。

Posted in 絮语心情 | Leave a comment

google reader full feed mod 全文脚本

本来不想更新博客的,因为我以为一周更新一次,才是最好的状态,否则就显得自己写在博客上的东西太过随意,缺乏价值。 但昨天发现这个插件之后,虽然在微博上更新了一条状态,但是还是觉得不过瘾,想在博客里面详细介绍一下这个脚本。 脚本地址:http://userscripts.org/scripts/show/78351 作者是一个日本人,主页在这里http://fxwiki.blog63.fc2.com/blog-category-7.html 实话说,介绍我一个看不懂,不过对使用没什么影响。安装了脚本之后,设置会出现一个full feed mod setting。 这里面有两个设置要注意一下:Try loading full story without a site info,这个要选中。 还有一个是auto load,根据white list读取全文。然后找到一篇不能全文的条目,在G图表上ctrl+左击,添加到白名单里面,然后就可以了。 之后点击这个feed中的条目,便会自动载入全文,当然,更多的设置我就不知道了,按理来说应该可以和google reader full text changer一样,自己定义siteinfo的,自己研究的就不够了。 这个插件使用起来速度有点慢,对于一些网站的博客来说,效果很好,几个都成功了,包括cnbeta,但是我试了一下网不易,没有成功得到全文。但总体而言,还是让人满意的。

Posted in 技术相关 | Tagged , , | Leave a comment

百度指数的提取

最近一个多月,我一直在想做一个题目,百度指数和股价的关系。前几天刚刚把程序弄好,可以把指数提取出来的时候,在The Journal of Finance上面的 Forthcoming Article Abstract,找到了这篇In Search of Attention。 几乎是和我一样的想法,但是做的工作显然比我能做的更多,更好。顿时自己的心凉了半截,继续做下去的冲动都没了。不过今天和导师交流了一下,说你数据都弄好了,不在做做实在是有点可惜,那么我就当练手,抱着学习面板分析的态度继续搞下去吧。 不过虽然我这个题目已经被人做掉了,但是百度指数(反应了别人百度某关键词的次数)和社会科学的关系,还有许多其他课题可以做,因为他其实反应的是老百姓的注意力。通常我们很难将其量化,用这个代理变量,我觉得可以做不少分析。国外已经开始用社交网络的数据分析了,我们这边见到文献的倒是不多。不过国内外被广泛认可的东西我就没有见到了,刚刚那篇文章还在预发表嘛。很多以前的理论,因为没有数据,很难做分析,现在用这种搜索数据,或者社交网络数据,可以做的东西就很多了。 如果百度指数开发api,能做的东西就更多了。自己也有点像利用微博和社交网络开发的api,做一些数据的提取分析,我觉得这个也很有意思,虽然国外已经开始不少人在开始做,国内似乎见过一些公司在做这个,好像杜子健就是一个。 好了,闲话不提,说说百度指数的提取吧。我用的是matlab的图像处理,提取图像的曲线。效果如下: 原图(百度指数页面点击生成图片): 提取后的的效果: 上图绿色的就是提取后数据绘制的线条,和原来的线条基本是重合的。我把提取后的数据和原始数据做了一个比较,最大的误差在3%左右,还是可以让人满意的。 本来想把matlab程序也在这里提供了,发现自己居然再这个空间上面不能在建立独立页面了,那就算了吧。

Posted in 学术研究 | Tagged , , | 34 Comments