Data & research

Data & research / CASE STUDY

Classifying a year of newspaper articles

Video by 李不凯正在研究Creator’s demonstration

IN THE CREATOR’S WORDS

这两天关于 Jev 这个模型的热度非常之高,甚至可以说是近半年我重点关注了英推以来,看到的原创内容密度最高的一次。 正好我过去一年一直在跑一个小项目,其中有一个环节就是要对每天出版的《人民日报》上的新闻做一个分类,判断每一篇文章中是否包含有湖北相关的元素。 一年跑下来,积累了接近 2 万 4 千条数据,其中判定包含的有 1800 条左右。在这些数据的基础上,我随机筛选了一个测试数据集,其中包含了 500 条判定包含的内容,以及 500 条判定不包含的内容。 之前我使用的模型一直是 Gemini 的…
Read the full original post