计算机视觉方向综述
一、什么是计算机视觉?
计算机视觉是让机器从图片、视频中自动看懂内容、理解场景、判断行为、重建空间、创造内容的AI技术。
简单分为五层能力,越往后越高级:
-
看得见:识别这是什么东西
-
找得到:知道东西在哪里
-
分得清:精准勾勒物体轮廓
-
看得懂:理解行为、语义、场景
-
能创造:AI画图、AI生成视频、重建3D世界
二、计算机视觉六大核心方向
1. 基础2D感知方向(CV的地基)
这是所有视觉算法的基础,90%的传统项目都离不开它,属于入门必学。
-
图像分类:给整张图片打标签。比如判断图片是猫、狗、车、人。最简单、最基础。
-
目标检测:不仅知道是什么,还知道在哪里。用方框框出行人、车辆、红绿灯。 代表:YOLO、Faster RCNN,工业最常用。
-
语义分割:像素级精细识别,画出物体轮廓。 重点:车道线检测、路面可行驶区域、医疗病灶分割都属于这一类。
-
实例分割:区分“同类不同个体”,比如一张图里区分多个人、多辆车。

依次是图像分类、目标检测、语义分割。
一句话总结:分类看整体,检测找位置,分割画轮廓。
2. 视频与时序视觉方向(动态场景)
如果说上面是“看一张照片”,这个方向就是看一段视频。
主要解决动态问题:
-
多目标跟踪:车来人往,持续跟踪同一个目标,不串ID(自动驾驶、监控必备)
-
行为识别:判断站立、摔倒、奔跑、挥手
-
异常检测:工地未戴安全帽、禁区闯入、违规停留
-
视频增强:视频超分、防抖、补帧
3. 3D视觉 / 几何视觉(目前高薪热门)
2D只能看平面,3D视觉能看懂距离、高度、空间结构,是自动驾驶、机器人的核心。

单目深度估计对比图、BEV 鸟瞰图感知示意图
主流任务:
-
深度估计:单张图片算出物体离镜头多远
-
点云处理:激光雷达三维感知
-
SLAM:机器人边走边建地图、定位
-
BEV鸟瞰图感知:自动驾驶当前主流方案
-
NeRF三维重建:照片重建高质量3D场景,元宇宙热门
优势:技术壁垒高、人才少、薪资高于普通2D视觉。
4. 多模态视觉(大模型时代核心)
以前的CV只会看图,现在的AI看图+读文字+懂语义,这就是多模态。

通俗理解:
-
单模态:只能识别“这是一只猫”
-
多模态:可以回答“这只猫是什么颜色?”“图中有几辆车?”
核心应用:
-
OCR文字识别
-
图像描述、看图问答
-
以文搜图、以图搜文
-
文字指挥AI找物体
5. 生成式视觉 AIGC(前沿)
传统CV是“看懂图片”,AIGC视觉是“创造图片”。
包括:
-
文生图、图生图
-
老照片修复、模糊变清晰
-
AI视频生成、视频换背景
-
可控生成(姿态、草图、轮廓控制画面)
适合喜欢创新、想做AIGC、新媒体、创意AI的同学。
6. 行业落地视觉
把CV技术落地到具体行业,是企业需求量最大、最稳定的方向。
-
自动驾驶视觉:车道线检测、红绿灯识别、障碍物感知、可行驶区域分割
-
工业机器视觉:产品瑕疵、划痕、污渍、尺寸检测
-
医疗视觉:CT、MRI、胸片病灶检测与分割
-
人脸与人体视觉:人脸识别、活体检测、姿态估计、手势识别
-
遥感与无人机:地物提取、灾害监测、航拍分析
更多推荐




所有评论(0)