# 07 · 04何人何物何时何地为何

<div style="background:#f5f0e8;border-radius:8px;padding:12px 16px;margin:16px 0;display:flex;align-items:center;gap:12px;">
  <span style="font-size:14px;color:#666;">🔊 全文章节朗读</span>
  <audio controls preload="none" style="flex:1;height:36px;">
    <source src="https://s3.gksj.cc/ab-0815832b19604c58/ai30/07.mp3" type="audio/mpeg">
  </audio>
</div>

# 04何人何物何时何地为何

第四章，何人，何物，何时，何地，为何。本章主题是计算机视觉为什么看起来容易做起来难。作者开篇用一张士兵回家抚摸爱狗的照片说明，人类看一眼就能讲出人物、地点、情感和前因后果，而机器连识别一条狗都很费劲。1966年明斯基曾让一个本科生用一个夏天搭建视觉系统，结果几乎毫无进展。突破来自对大脑的模拟：神经科学家胡贝尔和威塞尔发现视皮层是层次化结构，低层神经元检测边缘，越往上检测的特征越复杂，这个发现启发了福岛邦彦的神经认知机，进而催生了杨立昆提出的卷积神经网络。作者详细拆解了卷积网络的工作原理：第一层的单元用卷积运算检测垂直、水平等边缘方向，形成激活特征图，层层叠加后检测眼睛、尾巴等复杂特征，最后由分类模块输出对狗或猫的置信度。关键在于，这些检测器不是人为内置的，而是靠反向传播算法从大量标注图像中训练出来的。章末指出，卷积网络从冷门走向统治地位，还要归功于大数据这场技术革命。

---

*自动同步自湛庐有声书管线 · [HedgeDoc 原页](https://doc.gksj.cc/)*