搜索

Python 教学

基本介绍

Python 学习导读 使用 Google Colab 使用 Anaconda 使用 Python 虚拟环境 Python 范例集锦

数据型别

变数 variable 变数 ( 全域、区域 ) 数字 number 文字与字串 string 文字与字串 ( 常用方法 ) 文字与字串 ( 格式化 ) 串列 list 串列 ( 常用方法 ) 元组/数组 tuple 字典 dictionary 集合 set

语法观念

缩排和注解 运算子 operator 逻辑判断 ( if、elif、else ) 逻辑判断 ( and 和 or ) 重复循环 ( for、while ) 例外处理 ( try、except ) 生成式 comprehension 对象类别 class 对象继承 inheritance 导入模组 import

函数操作

函数 function 匿名函数 lambda 递回 recursion 产生器 generator 装饰器 decorator 闭包 closure

内建函数&方法

输入与输出 数学计算 字串操作与转换 迭代对象转换 迭代对象操作 文件读写 ( open ) eval() 与 exec()

标准函数库&模组

随机数 random 数学 math 数学统计函数 statistics 时间与日期 datetime 时间处理 time 日历 calendar 使用正规表达式 re 文件操作 os 查找匹配文件 glob 压缩文件 zipfile 高阶文件操作 shutil 高效迭代器 itertools 容器数据型态 collections CSV 文件操作 JSON 文件操作 threading 多执行绪处理 concurrent.futures

网络爬虫

Python 网络爬虫导读 关于网络爬虫 破解反爬虫的方法 Requests 函数库 Beautiful Soup 函数库 Selenium 函数库 爬取 PTT 文章标题 自动下载 PTT 正妹图片 同时下载多张图片 同时下载多张宝可梦图片 爬取 CCTV 即时图像 爬取统一发票号码对奖 爬取空气质量指标 ( AQI ) 爬取气象预报 爬取现在天气 LINE Notify 雷达回波图 LINE Notify 即时地震信息 爬取台湾银行牌告汇率 爬取 Yahoo 股市即时股价 爬取 LINE TODAY 留言 批次下载 Pinterest 图片 登录 Mobile01 截图下载 Twitter 自动上传图文

网页服务与应用

Flask 函数库 使用 ngrok 服务 Google Cloud Functions 串接 Gmail 寄送电子邮件 读取 Google 试算表 写入 Google 试算表 上传 Google 云端硬盘 发送 LINE Notify 通知 使用 Dialogflow Dialogflow + Webhook 服务器串接 Dialogflow 串接 Firebase 数据库 (1) 串接 Firebase 数据库 (2) 串接 Firebase 数据库 (3) 使用 OpenAI ChatGPT ChatGPT + Firebase

LINE BOT 教学

LINE BOT 教学导读 ( 免程序 ) 建立 LINE 官方账号 ( 免程序 ) 主动推播消息 ( 免程序 ) 自动回复消息 ( 免程序 ) 建立图文选单 ( 免程序 ) 基本消息类型 建立 LINE Channel 设定 Colab 开发环境 建立并串接 Webhook 解析 LINE 的消息 自动回复消息 主动推播消息 建立图文选单 切换图文选单 发送样板消息 发送 Flex Message 使用 Requests 传送消息 使用 LINE URL Scheme 储存用户的图片或影片 串接 Email 传送图片或影片 串接 Google 云端硬盘 气象机器人 (1) 气象机器人 (2) 气象机器人 (3) 气象机器人 (4) 串接 Dialogflow (1) 串接 Dialogflow (2) 串接 Dialogflow (3) 串接 Dialogflow (4) 串接 OpenAI ChatGPT (1) 串接 OpenAI ChatGPT (2) 串接 OpenAI ChatGPT (3)

OpenCV 教学

OpenCV 教学导读 OpenCV 函数库 打开并显示图片 写入并储存图片 读取并播放影片 写入并储存影片 取得图像信息 旋转/翻转/改变尺寸 图像的几何变形 图像的色彩转换 绘制各种形状 图像加入文字 剪裁图像 调整对比和亮度 负片效果 图像模糊化 图像的叠加与相减 二值化黑白图像 图像的侵蚀与膨胀 图像边缘侦测 魔术棒填充颜色 图像遮罩 边缘羽化效果 马赛克效果 子母画面影片 万花筒影片效果 多画面延迟播放影片 搞笑全景影片合成效果 凸透镜效果 ( 鱼眼效果 ) 倒数计时自动拍照效果 线性渐层填色 合成半透明图片 将指定的颜色变透明 处理 gif 动画 影片转透明 gif 动画 辨识 QRCode 和 BarCode 扫描 QRCode 切换效果 侦测鼠标事件 鼠标选取自动马赛克 即时在影片中绘图 侦测键盘行为 加入滑杆 ( Trackbar ) 拍照上传 Google 云端硬盘

AI 图像辨识教学

AI 图像辨识教学导读 OpenCV 人脸侦测 OpenCV 人脸马赛克 OpenCV 五官侦测 OpenCV 汽车侦测 OpenCV 行人侦测 OpenCV 辨识不同人脸 OpenCV 单对象追踪 OpenCV 多对象追踪 OpenCV 抓取特定颜色 OpenCV 追踪并标记颜色 情绪辨识与年龄侦测 辨识微笑,拍照储存 使用 Mediapipe ( 新 ) Mediapipe 人脸侦测 ( 新 ) Mediapipe 人脸特征点侦测 ( 新 ) Mediapipe 手掌侦测 ( 新 ) 使用 Mediapipe ( 旧 ) Mediapipe 人脸侦测 ( 旧 ) Mediapipe 人脸网格 ( 旧 ) Mediapipe 手掌侦测 ( 旧 ) Mediapipe 姿势侦测 Mediapipe 全身侦测 Mediapipe 物体侦测 Mediapipe 人物去背 Mediapipe 手势辨识 辨识比中指,自动马赛克 用手指在影片中画图 手指擦除镜子雾气效果 即时合成搞笑橘子脸 Jupyter 安装 Tensorflow 使用 Teachable Machine 辨识剪刀、石头、布 辨识是否戴口罩 辨识手写数字

NumPy 教学

NumPy 教学导读 NumPy 函数库 数据型态 建立数组 读取数组 迭代数组 数组项目赋值 修改数组形状 修改数组项目 填充数组 分割数组 合并数组 数组排序 广播 搜索数组项目 算数计算 数学函数 随机数 字串操作处理

matplotlib 图表

matplotlib 教学导读 matplotlib 函数库 Figure 和 Axes Figure 参数设定 建立多个子图表 设定图表标签 设定座标轴位置 设定座标轴刻度文字 数据文字标记 加入颜色对照表 使用极座标系统 使用 3D 图表 图表显示中文 下载储存图表 显示图片 制作图表动画 ( 图表 ) 折线图 ( 图表 ) 散布图 ( 图表 ) 长条图 ( 图表 ) 圆饼图 ( 图表 ) 甜甜圈图 ( 图表 ) 等高线图 ( 图表 ) 阶梯折线图 ( 图表 ) 堆叠折线图 ( 图表 ) 堆叠长条图 ( 图表 ) 极座标长条图 ( 图表 ) 极座标散布图 ( 图表 ) 3D 柱状长条图 ( 图表 ) 3D 散布图

Tkinter 界面设计

建立 Tkinter 视窗 Label 标签 Button 按钮 Radiobutton 单选按钮 Checkbutton 复选按钮 Entry 单行输入框 Text 多行输入框 Listbox 列表选择框 OptionMenu 下拉选单 Scale 数值调整滑杆 Spinbox 数值调整元件 Frame 框架 LabelFrame 标签框架 Scrollbar 滚动条 Canvas 画布 Menu 选单 Messagebox 消息提示框 Photoimage 显示图片 ttk.Progressbar 进度条 ttk.Combobox 下拉选单 Pack 基本版面布局 Grid 格状版面布局 Place 位置版面布局 范例 - Label 制作时钟 范例 - 点击按钮开文件 范例 - 打开多个文件 范例 - 打开并压缩文件 范例 - 打开并显示图片 范例 - 调整图片亮度对比 范例 - 简单计算机 范例 - 发送 LINE Notify

PyQt5 界面设计

PyQt5 函数库 使用 Qt designer 建立 PyQt5 视窗 QLabel 标签 QPushButton 按钮 QRadioButton 单选按钮 QCheckBox 复选按钮 QGraphicsView 显示图片 QLineEdit 单行输入框 QTextEdit 多行输入框 QListWidget 列表选择框 QComboBox 下拉选单 QSpinBox 数值调整元件 QTimeEdit 时间调整元件 QDateEdit 日期调整元件 QSlider 数值调整滑杆 QProgressBar 进度条 QFileDialog 选择文件视窗 QMessageBox 对话视窗 QInputDialog 输入视窗 QMenuBar 视窗选单 QTimer 定时器 QThread 多执行绪 QtCore.pyqtSignal 信号传递 QtMultimedia 播放声音 QPainter 绘图 QPainter 绘图 ( QPen ) QPainter 绘图 ( 储存图片 ) QSS 样式设定 QWebEngineView 网页显示 Layout 布局 ( 垂直水平 ) Layout 布局 ( Grid 网格 ) Layout 布局 ( Form 表单 ) 侦测鼠标事件 侦测键盘与快速键组合 侦测与控制视窗 视窗中打开新视窗 显示图片的三种方法 显示 Matplotlib 图表 显示 Pillow 图片 显示 OpenCV 图片和影片 范例 - 世界时钟 范例 - 简单计算机 范例 - 储存文件为压缩档 范例 - 发送 LINE Notify 范例 - 电脑摄影机 范例 - 摄影机拍照录影 范例 - 简单录音机 范例 - 小画家 范例 - 打开图片转档储存 范例 - 调整图片亮度对比

PyQt6 界面设计

PyQt6 函数库 PyQt6 和 PyQt5 的差异 建立 PyQt6 视窗 QLabel 标签 QPushButton 按钮 QRadioButton 单选按钮 QCheckBox 复选按钮 QGraphicsView 显示图片 QLineEdit 单行输入框 QTextEdit 多行输入框 QListWidget 列表选择框 QComboBox 下拉选单 QSpinBox 数值调整元件 QTimeEdit 时间调整元件 QDateEdit 日期调整元件 QSlider 数值调整滑杆 QProgressBar 进度条 QFileDialog 选择文件视窗 QMessageBox 对话视窗 QInputDialog 输入视窗 QMenuBar 视窗选单 QTimer 定时器 QThread 多执行绪 QtCore.pyqtSignal 信号传递 QtMultimedia 播放声音 QPainter 绘图 QPainter 绘图 ( QPen ) QPainter 绘图 ( 储存图片 ) QSS 样式设定 QWebEngineView 网页显示 Layout 布局 ( 垂直水平 ) Layout 布局 ( Grid 网格 ) Layout 布局 ( Form 表单 ) 侦测鼠标事件 侦测键盘与快速键组合 侦测与控制视窗 视窗中打开新视窗 显示图片的三种方法 显示 Matplotlib 图表 显示 Pillow 图片 显示 OpenCV 图片和影片 范例 - 世界时钟 范例 - 简单计算机 范例 - 储存文件为压缩档 范例 - 发送 LINE Notify 范例 - 电脑摄影机 范例 - 摄影机拍照录影 范例 - 简单录音机 范例 - 小画家 范例 - 打开图片转档储存 范例 - 调整图片亮度对比

影音处理范例

批次图片转档 批次调整图片尺寸 调整图片亮度和对比 裁切与旋转图片 拼接多张图片 图片加上 logo 浮水印 图片加上文字浮水印 图片马赛克效果 图片模糊化 图片锐利化 读取与修改图片 Exif 图片转文字 ( OCR ) 读取声音信息、输出声音 声音剪辑与串接 声音音量调整 声音混合与反转 改变声音速度 播放声音 麦克风录音 合成音符声音 显示声波图形 影片转档 取出影片声音或加入声音 影片剪辑与合并 影片混合与排列显示 改变影片尺寸、旋转翻转 调整影片速度、倒转影片 调整影片亮度/对比/颜色 影片转 gif 动画 影片中加入文字 影片自动加上字幕 影片截图、图片转影片

实际应用范例

下载 Youtube 影片 下载 Youtube 清单影片 定时自动屏幕截图 LINE Notify 传送屏幕截图 建立 MJPEG 即时图像串流 批次重新命名文件 产生 QRCode 产生 BarCode 读取 PDF 内容 PDF 拆分/合并/插入/删除 读取 EXCEL 内容 写入数据到 EXCEL CSV 写入 EXCEL 读取电脑信息 侦测电脑屏幕分辨率 查询电脑对内对外 IP 查询网站 IP、ping IP 制作 MacOS app

基础范例

电费试算 摄氏/华氏转换 厘米/英寸换算 判断平年与闰年 找出不重复字元 找出中间的字元 去除中英文夹杂的空白 大乐透电脑选号 下载进度条 星号金字塔 数字金字塔 猜数字 ( 猜大猜小 ) 猜数字 ( 几 A 几 B ) 简单时钟 ( 世界时间 ) 计算 BMI 数值 计算年纪 ( 岁、月、天 ) 产生身份证字号 ( 随机 ) 检查身份证字号 统一发票对奖 罗马数字转换

数学范例

两个数字的四则运算 计算多个数字的总和 费波那契数列 九九乘法表 质因数分解 快速找出质数 最小公倍数 ( 多个数字 ) 最大公因数 ( 多个数字 )

ZeroJudge 解答

关于 ZeroJudge a001: 哈啰 a002: 简易加法 a003: 两光法师占卜术 a004: 文文的求婚 a005: Eva 的回家作业 a006: 一元二次方程序 a009: 解码器 a010: 因数分解 a013: 罗马数字 a015: 矩阵的翻转 a017: 五则运算 a020: 身份证检验 a021: 大数运算 a022: 回文 a024: 最大公因数(GCD) a034: 二进位制转换 a038: 数字翻转 a040: 阿姆斯壮数 a042: 平面圆形切割 a044: 空间切割 a053: Sagit's 计分程序 a054: 电话客服中心 a058: MOD3 a059: 完全平方和 a065: 提款卡密码 a095: 麦哲伦的阴谋 a104: 排序 a147: Print it all a148: You Cannot Pass?! a149: 乘乘乐 a215: 明明爱数数 a216: 数数爱明明 a224: 明明爱明明 a225: 明明爱排列 a244: 新手训练~for+if a248: 新手训练~数组应用 a263: 日期差几天 a271: 彩色萝卜 a291: nAnB problem a410: 解方程 a414: 比特运算之进位篇 a417: 螺旋矩阵 a524: 手机之谜 a528: 大数排序 a647: 投资专家 a693: 吞食天地 a738: 最大公约数 a746: 画蛇添足 a799: 正值国 a915: 二维点排序 b265: Conformity b294: 经济大恐荒 b367: 翻转世界 b374: 求众数 b511: 换铜板 b558: 求数列第 n 项 e267: Group Reverse d073: 分组报告 d294: 算算算 Easy d485: 我爱偶数 d827: 买铅笔

破解反爬虫的方法

“反爬虫”主要是针对“恶意的爬虫程序”所设计的防堵技术,许多网站为了保护数据或减少网页负担,多少都会加入一些“反爬虫”机制,本篇教学将会介绍一些破解反爬虫的方法,可以针对一些简单的反爬虫机制,进行对应的处理。

快速导览:

执行 selenium 会启动 chromedriver,所以所以请使用本机环境 ( 参考:使用 Python 虚拟环境 ) 或使用 Anaconda Jupyter 进行实作 ( 参考:使用 Anaconda ) 。

常见的反爬虫方式

“反爬虫”主要是针对“恶意的爬虫程序”所设计的防堵技术,许多网站为了保护数据、减少网页负担、或避免网页上的公开信息被网页爬虫给抓取,多少都会押入一些“反爬虫”机制,常见的反爬虫机制有下列几种:

  • 判断浏览器 headers 信息

    利用 headers 判断来源是否合法,headers 通常会由浏览器自动产生,直接透过程序所发出的请求默认没有 headers,破解难度:低。

  • 使用动态页面

    将网页内容全部由动态产生,大幅增加爬虫处理网页结构的复杂度,破解难度:中低。

  • 加入用户行为判断

    在网页的某些元素,加入用户行为的判断,例如鼠标移动顺序、鼠标是否接触...等,增加爬虫处理的难度,破解难度:中。

  • 模拟真实用户登录授权

    在用户登录时,会将用户的授权 ( token ) 加入浏览器的 Cookie 当中,借由判断 Cookie 确认用户是否合法,破解难度:中。

  • 加入验证码机制

    相当常见的验证机制,可相当程度的防堵恶意的干扰与攻击,对于非人类操作与大量频繁操作都有不错的防范机制 ( 例如防堵高铁抢票、演唱会抢票...等 ),破解难度:高。

  • 封锁代理服务器与第三方 IP

    针对恶意攻击的 IP 进行封锁,破解难度:高

加入浏览器 headers 信息

针对“判断浏览器 headers 信息”的网页,只要能透过爬虫程序,送出模拟浏览器的 headers 信息,就能进行破解。

模拟 headers 常用的内容:

Mozilla/5.0 (Windows NT 6.1) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/52.0.2743.116 Safari/537.36

或

Mozilla/5.0 (Macintosh; Intel Mac OS X 10_13_6) AppleWebKit/605.1.15 (KHTML, like Gecko) Version/12.0.3 Safari/605.1.15

使用 Requests 函数库:

import requests
url = '要爬的網址'
# 假的 headers 資訊
headers = {'user-agent': 'Mozilla/5.0 (Windows NT 6.1) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/52.0.2743.116 Safari/537.36'}
# 加入 headers 資訊
web = requests.get(url, headers=headers)
web.encoding = 'utf8'
print(web.text)

使用 Selenium 函数库:

from selenium import webdriver
# 假的 headers 資訊
user_agent = "Mozilla/5.0 (Macintosh; Intel Mac OS X 10_13_6) AppleWebKit/605.1.15 (KHTML, like Gecko) Version/12.0.3 Safari/605.1.15"
opt = webdriver.ChromeOptions()
# 加入 headers 資訊
opt.add_argument('--user-agent=%s' % user_agent)
driver = webdriver.Chrome('./chromedriver', options=opt)
driver.get('要爬的網址')

清空 window.navigator

有些反爬虫的网页,会检测浏览器的 window.navigator 是否包含 webdriver 属性,在正常使用浏览器的情况下,webdriver 属性是 undefined,一旦使用了 selenium 函数库,这个属性就被初始化为 true,只要借由 Javascript 判断这个属性,就能简单的进行反爬虫。

下方的程序使用 selenium webdriver 的 execute_cdp_cmd 的方法,将 webdriver 设定为 undefined,就能避开这个检查机制。

from selenium import webdriver
driver = webdriver.Chrome('./chromedriver')
driver.execute_cdp_cmd("Page.addScriptToEvaluateOnNewDocument", {
  "source": """
    Object.defineProperty(navigator, 'webdriver', {
      get: () => undefined
    })
  """
})

解析动态页面

针对“使用动态页面”的网页,只要确认动态页面的架构,就能进行破解,如果打开的网页是动态页面,“检视网页源代码”时看到的结构往往会很简单,通常都只会是一些简单的 HTML、CSS 和压缩过的 js 文件。

Python 教学 - 破解反爬虫的基本策略 - 解析动态页面

这时可以使用 Chrome 打开网页,在网页任意位置按下鼠标右键,选择“检视”,打开 Chrome 开发者工具,从中就能看到动态网页加载后的完整架构。

Python 教学 - 破解反爬虫的基本策略 - 打开 Chrome 开发者工具

Python 教学 - 破解反爬虫的基本策略 - 动态网页加载后的完整架构

取得网页结构后,进一步分析网页结构,下方的程序使用 Selenium 函数库的功能,抓取特定的网页元素或进行指定的动作。

from selenium import webdriver

driver = webdriver.Chrome('./chromedriver')
driver.get('爬取的網址')
# 從載入後的動態網頁裡,找到指定的元素
imgCount = driver.find_element(By.CSS_SELECTOR, 'CSS 選擇器')

判断用户行为

针对“加入用户行为判断”的网页,确认页面加入的用户行为,就能模拟并进行破解,举例来说,有些网页会在按钮加上“鼠标碰触”的保护,如果不是真的用鼠标碰触,只是用程序撰写“点击”指令,就会被当作爬虫而被阻挡。

下方的程序使用 Selenium 函数库的功能,模拟出先碰触元素,再进行点击的动作,借此突破这个反爬虫的机制。

from selenium import webdriver
from selenium.webdriver.common.action_chains import ActionChains
submitBtn = driver.find_element(By.CSS_SELECTOR, '#submitBtn')
actions = ActionChains(driver)
# 滑鼠先移到 submitBtn 上,然後再點擊 submitBtn
actions.move_to_element(submitBtn).click(submitBtn)
actions.perform()

有些网页也会判断用户刷新网页的时间 ( 通常用户不会在极短的时间内连续刷新 ),这时也可以使用 time 函数库的 sleep 方法让网页有所等待,避开这个检查机制

from selenium import webdriver
from time import sleep
submitBtn = driver.find_element(By.CSS_SELECTOR, '#submitBtn')
sleep(1)     # 等待一秒
submitBtn.click()
sleep(0.5)   # 等待 0.5 秒
submitBtn.click()

提交用户授权

针对“模拟真实用户登录授权”的网页,只要知道 request 与 response 的机制后,取得 Cookie 内的 token 就能破解。举例来说,下图为 Ptt 八卦版网页,从 Chrome 开发者工具里可以看到所需要的 Cookies 信息。

Python 教学 - 破解反爬虫的基本策略

知道所需的 cookies 信息后,就能在 Requests 函数库里,增加相对应的信息,就能顺利爬取到数据。

import requests
cookies = {'over18':'1'}
# 加入 Cookies 資訊
web = requests.get('https://www.ptt.cc/bbs/Gossiping/index.html', cookies=cookies)
print(web.text)

破解验证码

针对“加入验证码机制”的网页,必须搭配一些 AI 来处理图形、数字、文字的识别,通常只要能识别验证码就能破解。如果要破解一般验证码,需要先将网页上的验证码图片下载,再将图片提交到 2Captcha 服务来帮我们进行辨识,等同于执行两次爬虫,先爬取目标网页,在爬取 2Captcha 网页取得辨识后的验证码,最后再把验证把输入目标网页。

因为步骤较为繁复,会用另外的篇幅介绍,此处仅介绍相关的原理。

2Captcha 服务:https://2captcha.com/

Python 教学 - 破解反爬虫的基本策略 - 破解验证码

破解代理服务器与第三方 IP 封锁

针对“封锁代理服务器与第三方 IP”的网页,通常必须更换 IP 或更换代理服务器才能破解,许多网站上也有提供免费的 Proxy IP,以 Free Proxy List 网站为例,就能取得许多免费的 Proxy IP。

Free Proxy List:https://free-proxy-list.net/

Python 教学 - 破解反爬虫的基本策略 - 破解代理服务器与第三方 IP 封锁

下方的程序码会透过代理服务器 IP 的方式,执行 requests 函数库的 get 方法,如果该 IP 已经无法使用,就会出现 invalid 的提示。

import requests
# 建立 Proxy List
proxy_ips = ['80.93.213.213:3136',
'191.241.226.230:53281',
'207.47.68.58:21231',
'176.241.95.85:48700'
]
# 依序執行 get 方法
for ip in proxy_ips:
    try:
        result = requests.get('https://www.google.com', proxies={'http': 'ip', 'https': ip})
        print(result.text)
    except:
        print(f"{ip} invalid")

Python 教学 - 破解反爬虫的基本策略

小结

其实反爬虫的机制非常的多变 ( 甚至有些还会用一问一答的方式 ),不过也有很多网站没有加上反爬虫的保护,甚至直接提供了 API 的方式来让爬虫获取数据,总而言之,如果有 API 就直接取用,如果没有 API 又遇上反爬虫,就只能针对反爬虫的机制,采取对应的措施了。

意见反馈

微信二维码 微信扫码关注 抖音二维码 抖音扫码关注