一、什么是计算机视觉?

计算机视觉是让机器从图片、视频中自动看懂内容、理解场景、判断行为、重建空间、创造内容的AI技术。

简单分为五层能力,越往后越高级:

  • 看得见:识别这是什么东西

  • 找得到:知道东西在哪里

  • 分得清:精准勾勒物体轮廓

  • 看得懂:理解行为、语义、场景

  • 能创造:AI画图、AI生成视频、重建3D世界

二、计算机视觉六大核心方向

1. 基础2D感知方向(CV的地基)

这是所有视觉算法的基础,90%的传统项目都离不开它,属于入门必学

  • 图像分类:给整张图片打标签。比如判断图片是猫、狗、车、人。最简单、最基础。

  • 目标检测:不仅知道是什么,还知道在哪里。用方框框出行人、车辆、红绿灯。 代表:YOLO、Faster RCNN,工业最常用。

  • 语义分割:像素级精细识别,画出物体轮廓。 重点:车道线检测、路面可行驶区域、医疗病灶分割都属于这一类。

  • 实例分割:区分“同类不同个体”,比如一张图里区分多个人、多辆车。

  

依次是图像分类、目标检测、语义分割。

一句话总结:分类看整体,检测找位置,分割画轮廓。

2. 视频与时序视觉方向(动态场景)

如果说上面是“看一张照片”,这个方向就是看一段视频

主要解决动态问题:

  • 多目标跟踪:车来人往,持续跟踪同一个目标,不串ID(自动驾驶、监控必备)

  • 行为识别:判断站立、摔倒、奔跑、挥手

  • 异常检测:工地未戴安全帽、禁区闯入、违规停留

  • 视频增强:视频超分、防抖、补帧

3. 3D视觉 / 几何视觉(目前高薪热门)

2D只能看平面,3D视觉能看懂距离、高度、空间结构,是自动驾驶、机器人的核心。

   

单目深度估计对比图、BEV 鸟瞰图感知示意图

主流任务:

  • 深度估计:单张图片算出物体离镜头多远

  • 点云处理:激光雷达三维感知

  • SLAM:机器人边走边建地图、定位

  • BEV鸟瞰图感知:自动驾驶当前主流方案

  • NeRF三维重建:照片重建高质量3D场景,元宇宙热门

优势:技术壁垒高、人才少、薪资高于普通2D视觉。

4. 多模态视觉(大模型时代核心)

以前的CV只会看图,现在的AI看图+读文字+懂语义,这就是多模态。

通俗理解:

  • 单模态:只能识别“这是一只猫”

  • 多模态:可以回答“这只猫是什么颜色?”“图中有几辆车?”

核心应用:

  • OCR文字识别

  • 图像描述、看图问答

  • 以文搜图、以图搜文

  • 文字指挥AI找物体

5. 生成式视觉 AIGC(前沿)

传统CV是“看懂图片”,AIGC视觉是“创造图片”

包括:

  • 文生图、图生图

  • 老照片修复、模糊变清晰

  • AI视频生成、视频换背景

  • 可控生成(姿态、草图、轮廓控制画面)

适合喜欢创新、想做AIGC、新媒体、创意AI的同学。

6. 行业落地视觉

把CV技术落地到具体行业,是企业需求量最大、最稳定的方向。

  • 自动驾驶视觉:车道线检测、红绿灯识别、障碍物感知、可行驶区域分割

  • 工业机器视觉:产品瑕疵、划痕、污渍、尺寸检测

  • 医疗视觉:CT、MRI、胸片病灶检测与分割

  • 人脸与人体视觉:人脸识别、活体检测、姿态估计、手势识别

  • 遥感与无人机:地物提取、灾害监测、航拍分析

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐