最新《字体反爬策略及理论分析》
zhezhongyun 2025-04-29 06:46 21 浏览
CSS3时代,开发者使用@font-face为网页指定字体,就不必依赖计算机字体。在爬虫的过程中,就有了下面这种情况:
这里评分、评论人数、票房的网页源码为乱码。
1、字体加载原理
我们访问页面的时候,源代码会有以下类似的代码:
这里的src: url()括号里面就是字体下载的地址,有兼容多种浏览器的版本的url,我们通常用format('woff')的那个即可。把这个url拷贝到浏览器的地址栏中即可下载。
我们也可以通过浏览器的调试工具查看加载过程,会在Network--Font选项卡中看到:
下载好字体后,利用fontLab打开即可看到“字形码”和”对应的真正的数值“。这两个概念稍后会细说。
2、解决方法
我们爬虫抓取到的文本内容直接打印肯定会出现乱码,因为我们电脑上没有别人自定义的新字体。
第一步需要利用fontLab人工构建字形码:真正的数值的字典映射。
第二步通过这些乱码推导出字形编码,['uni' + '%x'.upper() % ord(i) for i in char_raw],即将每个字符转为16进制显示可得到字形码。之后利用上方的字典即可得到真正的数值。
通过css选择器获取乱码文本
之后再调用下图获取真正数字的函数即可
多数情况下网站就一套字体,毕竟制作字体的成本也较高,可以通过上方思路解决。当然,如果网站有多套字体就比较麻烦了,你可以说我每套字体都下载下来人工映射没问题。
关于多种字体的破解问题,以前是字形对象没有变,字形编码会变;现在是两者都变。所以利用字形对象相等的原理已经不行了。所以解决方法无非机器学习或者网上付费自动识别的api了。
下方简单介绍了字体、字形的概念,以及破解的难处。
3、字体背后的细节问题
(1)WOFF(Web Open Font Format,Web 开放字体格式)是一种网页所采用的字体格式标准。字体中的每个字形由网格上的一系列点展示出来,点是字体中的最小单位。
字体文件中不仅包含字形数据和点信息,还包括字符到字形映射、字体标题、命名和水平指标等,这些信息存在对应的表中。
这里通过Python的三方库,pip install fonttools,将字体存储为xml文件,打开后即可看到字体的详细信息。
from fontTools.ttLib import TTFont
font = TTFont('9fc50aa7.woff')
font.saveXML('movie.xml')
图中x和y即为点的坐标,这么多点构成了我们看到的字形。
(2)破解难处
以前我们可以比较字体对象是否相等来判断是否是同一个字,现在较难。
比如这个“6”,
第一: 每套字体同样是“6”,但点的个数不同;
第二: 还有可能是点的坐标会发生偏移。
下方这个图展示的是,不同字体对应相同字形的点的个数,蓝色线就是相同字形的点的差异:
下方这个图是,具体字形在fontLab中显示的点的对比(右边的3比左边的多了两个点):
同一个字形,点的坐标发生偏移,见下图:
以上就是全部内容了!
- 上一篇:一文教你学会维恩图的绘制——R语言
- 下一篇:css概念以及语法规则
相关推荐
- DevExpress使用教程:GridView经验小结
-
下面是笔者自己总结的使用DevExpressGridview的一些经验小结,分享给大家:1、去除GridView头上的"Dragacolumnheaderheretogroup...
- ComponentOne 新版本发布,新增 .NET 6 和 Blazor 平台控件支持
-
ComponentOneEnterprise是葡萄城推出的一款内置300多种开发控件的.NET控件集,可满足WinForm、WPF、Blazor、ASP.NETMVC等平台下的系统开发...
- Wijmo5 Flexgrid基础教程:数据绑定
-
WijmoEnterprise下载>FlexGrid在JavaScript程序中启动添加Wijmo引用;添加wijmo控件的扩展;在JavaScript中初始化wijmo控件;(可选)添加cs...
- Wijmo5 Flexgrid基础教程:InlineEdit
-
WijmoEnterprise下载>对于flexgrid,可以直接在单元格内进行编辑。但另外还有一种编辑方式,即在一行添加按钮,统一的编辑和提交数据。本文主要介绍给flexgrid添加编辑按钮...
- WinForms Data Grid控件升级(winform devexpress控件)
-
告诉大家一个好消息:慧都将于近期隆重推出“DevExpress14.2新版发布会”。心动不如行动,赶快报名吧!我们期待与您相约DevExpress14.2新版发布会。>>新增Wind...
- XAML控件宽度为另一控件的一半、静态属性绑定
-
控件上当某些数据需要根据其他数据的变化而变化很多时候,想让某个控件的宽度或者高度是另一个已有控件的一半,一开始打算使用ObjectDataProvider来实现,因为在控件上当某些数据需要根据其他数据...
- 用 CSS Grid 布局制作一个响应式柱状图
-
最新一段时间比较喜欢玩弄图表,出于好奇,我想找出比较好的用CSS制作图表的方案。开始学习网上开源图表库,它对我学习新的和不熟悉的前端技术很有帮助,比如这个:CSSGrid。今天和大家分享我学到的...
- Grid 移动端双列瀑布流(移动端瀑布流布局)
-
预览图:原理合理使用Grid的属性:display:设置为grid指明当前容器为Grid布局grid-template-columns:定义每一列的列宽(百分比或绝对单位)grid-templa...
- DevExpress导出GridControl控件数据
-
前言:使用C#做桌面应用时,我们会常常使用Winform作为我们的开发界面,但是windows自带的控件由于长时间不更新,已经不能够满足当前开发需要所以使用DevExpress控件作为Winform...
- css grid 布局的那些事儿(css grid布局和flex布局)
-
CSSGrid是一种为Web开发创建网站布局的方式。它已经存在了很多年,随着更多浏览器的支持,它终于变得越来越流行。接下来我们将了解下CSSGrid及其工作原理。了解下它如何使用。CSS...
- Grid.js - 跨框架的前端表格插件(前端table框架)
-
只想简简单单画个表格,但React,Vue,Angular,…,这么多前端框架,各自都有不同的表格渲染库。就没有表格库能“一次画表,到处运行”吗?来看看Grid.js这个跨框架的前端表格插件吧!...
- WPF开发教程01-布局控件(wpf tablecontrol控件)
-
布局控件是用于进行控件布局的容器类控件,其内部控件按照一定规律自动排列,且在父控件改变大小时,会自动适应。常用布局控件如下:1.一维布局控件(StackPanel)其内部控件按照某个维度自动排列,排...
- wxPython - 高级控件之表格Grid(wxpython grid刷新数据)
-
实战wxPython系列-043wx.grid.Grid及其相关类用于显示和编辑表格数据。它们提供了一组丰富的功能,用于显示、编辑和与各种数据源交互。wx.grid.Grid是一个功能强大的但是又稍微...
- 前端 BFC、IFC、GFC 和 FFC,这些你都知道吗?
-
如果觉得我的文章不错,可以关注我,想要看其他的进阶知识可以查看我发布过的文章!编辑搜图请点击输入图片描述BFC(Blockformattingcontexts):块级格式上下文页面上的一个隔离的...
- 20多个好用的 Vue 组件库,请查收
-
在本文中,我们将探讨一些最常见的vuejs组件。你可以收藏一波。VueTables-2地址:https://github.com/matfish2/vue-tables-2VueTables2...
- 一周热门
- 最近发表
-
- DevExpress使用教程:GridView经验小结
- ComponentOne 新版本发布,新增 .NET 6 和 Blazor 平台控件支持
- Wijmo5 Flexgrid基础教程:数据绑定
- Wijmo5 Flexgrid基础教程:InlineEdit
- WinForms Data Grid控件升级(winform devexpress控件)
- XAML控件宽度为另一控件的一半、静态属性绑定
- 用 CSS Grid 布局制作一个响应式柱状图
- Grid 移动端双列瀑布流(移动端瀑布流布局)
- DevExpress导出GridControl控件数据
- css grid 布局的那些事儿(css grid布局和flex布局)
- 标签列表
-
- HTML 教程 (33)
- HTML 简介 (35)
- HTML 实例/测验 (32)
- HTML 测验 (32)
- JavaScript 和 HTML DOM 参考手册 (32)
- HTML 拓展阅读 (30)
- HTML常用标签 (29)
- HTML文本框样式 (31)
- HTML滚动条样式 (34)
- HTML5 浏览器支持 (33)
- HTML5 新元素 (33)
- HTML5 WebSocket (30)
- HTML5 代码规范 (32)
- HTML5 标签 (717)
- HTML5 标签 (已废弃) (75)
- HTML5电子书 (32)
- HTML5开发工具 (34)
- HTML5小游戏源码 (34)
- HTML5模板下载 (30)
- HTTP 状态消息 (33)
- HTTP 方法:GET 对比 POST (33)
- 键盘快捷键 (35)
- 标签 (226)
- HTML button formtarget 属性 (30)
- CSS 水平对齐 (Horizontal Align) (30)