计算机视觉:定义原理、常见能力与落地应用场景
计算机视觉是让计算机理解图像和视频并提取信息的 AI 子领域。它通过机器学习、深度学习等方法支持图像识别、OCR,帮助判断计算机视觉应用场景。

什么是计算机视觉?
计算机视觉是人工智能的一个子领域,目标是让计算机处理、分析和理解图像、视频等视觉输入,并从中提取有意义的信息。它关注的不是简单保存图片或播放视频,而是让系统能够从视觉数据中识别对象、人物、模式、文字或其他可用于后续处理的数据。
可以把它理解为让计算机获得一种“看懂画面”的能力:人通过眼睛接收画面,再由大脑判断画面中有什么;计算机视觉则通过算法从像素、图像和视频中提取结构化结果,例如对象类别、图片标签、文字内容或地标信息。
要点: 计算机视觉的核心问题是:如何把图像、视频这类视觉输入,转化为计算机可以进一步使用的有意义数据。
计算机视觉与 AI、机器学习和深度学习的关系
计算机视觉不是孤立技术,它通常被放在 AI 技术体系中理解。AI 是更大的范畴,计算机视觉是其中面向视觉数据理解的方向;机器学习、深度学习和神经网络则常用于实现视觉识别、分类和分析能力。
| 概念 | 主要关注点 | 与计算机视觉的关系 |
|---|---|---|
| AI | 让系统表现出感知、识别、分析等智能能力 | 计算机视觉是 AI 的一个子领域 |
| 机器学习 | 让系统从数据中学习规律并获得有意义的信息 | 可用于从视觉数据中学习对象、模式或分类规则 |
| 深度学习 | 使用多层模型从数据中学习复杂特征 | 常用于图像、视频中的物体、人物和模式识别 |
| 神经网络 | 深度学习中常见的模型形式 | 可帮助系统识别物体、人物和视觉模式 |
| 计算机视觉 | 理解图像、视频等视觉输入 | 关注视觉数据的处理、分析、解读和信息提取 |
需要注意的是,计算机视觉并不等同于深度学习。它可以使用传统算法,也可以使用基于深度学习的算法。实际采用哪种方式,取决于任务目标、视觉数据类型以及需要提取的信息形式。
计算机视觉的基本工作方式
从概念层面看,计算机视觉系统通常围绕“输入视觉数据、处理和分析、输出有意义结果”展开。不同系统的工程实现会有差异,但基本逻辑可以概括为以下几个环节。
接收图像、视频或其他视觉输入
计算机视觉首先需要处理视觉数据,例如单张图片、连续视频帧、扫描件、截图或其他包含视觉信息的数字内容。这些输入是系统判断画面中对象、文字、人物或模式的基础。
使用算法处理、分析和解读视觉数据
系统会通过算法对视觉输入进行处理和分析。算法可以是传统计算机视觉算法,也可以是基于机器学习、深度学习和神经网络的方法。其目标是从图像或视频中识别出有意义的视觉特征与信息。
通过大量信息学习识别视觉数据
在许多机器学习或深度学习场景中,系统会通过输入大量信息来学习如何识别视觉数据。学习的结果可能表现为对对象类别、人物、模式、文字或地标的识别能力。
输出可使用的结构化结果
计算机视觉的输出通常不是“另一张图片”,而是可被应用程序继续使用的数据。例如:
- 对象名称或类别;
- 图片标签;
- 图像中的文字内容;
- 检测到的面孔或地标信息;
- 对内容是否包含不适宜元素的标记;
- 从图像或视频中提取出的模式或分析结果。
计算机视觉常见能力有哪些?
计算机视觉包含多种任务类型。不同任务的共同点是:都试图从图像、视频或视觉输入中提取可理解、可处理的信息。
| 能力 | 解决的问题 | 常见输出 |
|---|---|---|
| 物体识别与物体分类 | 判断画面中出现了什么对象,并给出类别 | 对象名称、类别标签 |
| 人物和模式识别 | 从图像或视频中发现人物、形状或重复特征 | 人物、模式或特征结果 |
| 图片标记 | 为图片生成描述性标签,便于检索和管理 | 图片标签、内容描述 |
| 面孔检测 | 检测画面中是否存在面孔及相关区域 | 面孔位置或检测结果 |
| 地标检测 | 判断图片中是否包含可识别的地标 | 地标名称或检测结果 |
| OCR 文字识别 | 从图片中识别文字内容 | 可检索、可处理的文本 |
| 露骨内容标记 | 辅助识别不适宜图片内容 | 内容安全相关标记 |
物体识别与物体分类
物体识别关注“画面中有什么”,物体分类关注“它属于哪一类”。例如系统可以分析图片或视频中的视觉信息,并输出某个对象的类别结果。
图片标记
图片标记会为图像生成描述性标签,使图片更容易被检索、归档和管理。对于大量图片内容,标签化结果可以帮助系统把非结构化视觉内容转化为更易处理的信息。
OCR 文字识别
OCR 是计算机视觉中常见的文字识别能力。它可以从扫描件、截图或其他图像中识别文字,将原本嵌在图片里的内容转化为可检索、可复制或可进一步处理的文本。
面孔、地标和内容安全相关检测
面孔检测、地标检测和露骨内容标记都属于面向特定目标的视觉检测能力。它们可以帮助应用理解图片中的人物区域、地点线索或不适宜内容标记,但具体结果通常还需要结合业务流程进一步使用。
计算机视觉应用场景如何理解?
理解计算机视觉应用场景,可以从“用户有什么视觉数据”和“希望从中得到什么信息”两点出发。只要需求以图像、视频或视觉输入为主要数据来源,并且目标是提取对象、文字、标签、人物、地标或模式,就可能适合使用计算机视觉。
| 用户需求 | 解决方式 | 效果 |
|---|---|---|
| 整理和检索大量图片 | 使用图片标记、对象识别或分类结果 | 提升图片归档、搜索和管理效率 |
| 从扫描件或截图中提取文字 | 使用 OCR 识别图像中的文字 | 将图片中的文字转为更容易处理的数据 |
| 理解图片中的地点线索 | 使用地标检测能力 | 辅助识别图片可能关联的地标信息 |
| 发现不适宜图片内容 | 使用露骨内容标记作为审核辅助 | 为内容安全流程提供初步标记 |
| 分析图像或视频中的人物、对象和模式 | 使用识别、检测或分类能力 | 输出结构化结果,便于后续应用处理 |
要点: 计算机视觉的价值通常不在于“看见图片”,而在于把视觉内容转化为标签、分类、文字、检测结果等可被系统使用的数据。
判断一个需求是否适合使用计算机视觉
并不是所有数据处理问题都适合归入计算机视觉。判断时,可以先看数据来源和目标输出是否与视觉信息有关。
适合使用计算机视觉的信号
- 主要数据来源是图片、视频、截图、扫描件或其他视觉输入;
- 目标是识别画面中的对象、人物、模式或类别;
- 需要从图片中提取文字,例如 OCR;
- 需要为图片生成标签,便于检索、归档或管理;
- 需要检测面孔、地标或特定内容标记;
- 输出结果可以表达为分类、检测、识别、标记或文本提取。
可能不属于典型计算机视觉的问题
- 数据主要是纯文本、表格或结构化字段;
- 目标是文本摘要、问答、翻译或表格计算;
- 不需要分析图像、视频或视觉输入本身;
- 输出不依赖对象、文字、标签、地标或视觉模式识别。
需求判断检查清单
| 检查问题 | 如果答案是“是” | 可能对应的能力 |
|---|---|---|
| 数据是否来自图片或视频? | 可以进一步考虑计算机视觉 | 图像分析、视频分析 |
| 是否需要判断画面中有什么? | 适合视觉识别或分类 | 物体识别、物体分类 |
| 是否需要从图片中提取文字? | 适合 OCR | OCR 文字识别 |
| 是否需要给图片打标签? | 适合图片标记 | 图片标记、内容归档 |
| 是否需要识别地点线索? | 可考虑地标检测 | 地标检测 |
| 是否需要辅助发现不适宜内容? | 可考虑内容标记 | 露骨内容标记 |
如果一个需求只是处理纯文本、表格或数据库字段,通常不属于典型的计算机视觉问题;如果它需要从视觉数据中提取对象、文字、标签、人物、地标或模式,则更适合用计算机视觉能力来建模和实现。