百度360必应搜狗淘宝本站头条
当前位置:网站首页 > 技术文章 > 正文

最新《字体反爬策略及理论分析》

zhezhongyun 2025-04-29 06:46 33 浏览

#python爬虫#

CSS3时代,开发者使用@font-face为网页指定字体,就不必依赖计算机字体。在爬虫的过程中,就有了下面这种情况:

这里评分、评论人数、票房的网页源码为乱码。


1、字体加载原理

我们访问页面的时候,源代码会有以下类似的代码:

这里的src: url()括号里面就是字体下载的地址,有兼容多种浏览器的版本的url,我们通常用format('woff')的那个即可。把这个url拷贝到浏览器的地址栏中即可下载。

我们也可以通过浏览器的调试工具查看加载过程,会在Network--Font选项卡中看到:

下载好字体后,利用fontLab打开即可看到“字形码””对应的真正的数值“。这两个概念稍后会细说。


2、解决方法

我们爬虫抓取到的文本内容直接打印肯定会出现乱码,因为我们电脑上没有别人自定义的新字体。

第一步需要利用fontLab人工构建字形码:真正的数值的字典映射。

第二步通过这些乱码推导出字形编码,['uni' + '%x'.upper() % ord(i) for i in char_raw],即将每个字符转为16进制显示可得到字形码。之后利用上方的字典即可得到真正的数值。

通过css选择器获取乱码文本

之后再调用下图获取真正数字的函数即可

多数情况下网站就一套字体,毕竟制作字体的成本也较高,可以通过上方思路解决。当然,如果网站有多套字体就比较麻烦了,你可以说我每套字体都下载下来人工映射没问题。

关于多种字体的破解问题,以前是字形对象没有变,字形编码会变;现在是两者都变。所以利用字形对象相等的原理已经不行了。所以解决方法无非机器学习或者网上付费自动识别的api了。

下方简单介绍了字体、字形的概念,以及破解的难处。


3、字体背后的细节问题

(1)WOFF(Web Open Font Format,Web 开放字体格式)是一种网页所采用的字体格式标准。字体中的每个字形由网格上的一系列点展示出来,点是字体中的最小单位。

字体文件中不仅包含字形数据和点信息,还包括字符到字形映射、字体标题、命名和水平指标等,这些信息存在对应的表中。

这里通过Python的三方库,pip install fonttools,将字体存储为xml文件,打开后即可看到字体的详细信息。

from fontTools.ttLib import TTFont

font = TTFont('9fc50aa7.woff')

font.saveXML('movie.xml')

图中x和y即为点的坐标,这么多点构成了我们看到的字形。


(2)破解难处

以前我们可以比较字体对象是否相等来判断是否是同一个字,现在较难。

比如这个“6”,

第一: 每套字体同样是“6”,但点的个数不同;

第二: 还有可能是点的坐标会发生偏移。

下方这个图展示的是,不同字体对应相同字形的点的个数,蓝色线就是相同字形的点的差异:

下方这个图是,具体字形在fontLab中显示的点的对比(右边的3比左边的多了两个点):

同一个字形,点的坐标发生偏移,见下图:

以上就是全部内容了!

相关推荐

perl基础——循环控制_principle循环

在编程中,我们往往需要进行不同情况的判断,选择,重复操作。这些时候我们需要对简单语句来添加循环控制变量或者命令。if/unless我们需要在满足特定条件下再执行的语句,可以通过if/unle...

CHAPTER 2 The Antechamber of M de Treville 第二章 特雷维尔先生的前厅

CHAPTER1TheThreePresentsofD'ArtagnantheElderCHAPTER2TheAntechamber...

CHAPTER 5 The King'S Musketeers and the Cardinal'S Guards 第五章 国王的火枪手和红衣主教的卫士

CHAPTER3TheAudienceCHAPTER5TheKing'SMusketeersandtheCardinal'SGuard...

CHAPTER 3 The Audience 第三章 接见

CHAPTER3TheAudienceCHAPTER3TheAudience第三章接见M.DeTrévillewasatt...

别搞印象流!数据说明谁才是外线防守第一人!

来源:Reddit译者:@assholeeric编辑:伯伦WhoarethebestperimeterdefendersintheNBA?Here'sagraphofStea...

V-Day commemorations prove anti-China claims hollow

People'sLiberationArmyhonorguardstakepartinthemilitaryparademarkingthe80thanniversary...

EasyPoi使用_easypoi api

EasyPoi的主要特点:1.设计精巧,使用简单2.接口丰富,扩展简单3.默认值多,writelessdomore4.springmvc支持,web导出可以简单明了使用1.easypoi...

关于Oracle数据库12c 新特性总结_oracle数据库12514

概述今天主要简单介绍一下Oracle12c的一些新特性,仅供参考。参考:http://docs.oracle.com/database/121/NEWFT/chapter12102.htm#NEWFT...

【开发者成长】JAVA 线上故障排查完整套路!

线上故障主要会包括CPU、磁盘、内存以及网络问题,而大多数故障可能会包含不止一个层面的问题,所以进行排查时候尽量四个方面依次排查一遍。同时例如jstack、jmap等工具也是不囿于一个方面的问题...

使用 Python 向多个地址发送电子邮件

在本文中,我们将演示如何使用Python编程语言向使用不同电子邮件地址的不同收件人发送电子邮件。具体来说,我们将向许多不同的人发送电子邮件。使用Python向多个地址发送电子邮件Python...

提高工作效率的--Linux常用命令,能够决解95%以上的问题

点击上方关注,第一时间接受干货转发,点赞,收藏,不如一次关注评论区第一条注意查看回复:Linux命令获取linux常用命令大全pdf+Linux命令行大全pdf为什么要学习Linux命令?1、因为Li...

linux常用系统命令_linux操作系统常用命令

系统信息arch显示机器的处理器架构dmidecode-q显示硬件系统部件-(SMBIOS/DMI)hdparm-i/dev/hda罗列一个磁盘的架构特性hdparm-tT/dev/s...

小白入门必知必会-PostgreSQL-15.2源码编译安装

一PostgreSQL编译安装1.1下载源码包在PostgreSQL官方主页https://www.postgresql.org/ftp/source/下载区选择所需格式的源码包下载。cd/we...

Linux操作系统之常用命令_linux系统常用命令详解

Linux操作系统一、常用命令1.系统(1)系统信息arch显示机器的处理器架构uname-m显示机器的处理器架构uname-r显示正在使用的内核版本dmidecode-q显示硬件系...

linux网络命名空间简介_linux 网络相关命令

此篇会以例子的方式介绍下linux网络命名空间。此例中会创建两个networknamespace:nsa、nsb,一个网桥bridge0,nsa、nsb中添加网络设备veth,网络设备间...