DAY 13 · 提示词设计 × 计算机视觉

HOW AI
INTERPRETS INPUT

AI 如何理解输入 From language constraints to visual features.

同样是“输入”,语言需要被组织成任务意图,图像需要被拆解成视觉特征。Day 13 用四组实验观察 AI 如何从复杂信息中提取结构、形成判断并输出结果。

Language prompts and visual images appear different, yet both ask the same fundamental question: how does AI transform raw input into structured interpretation and usable output?

LANGUAGE INPUT

语言 → 意图
Words → Intent
TASKUSERCONTEXTROLECONSTRAINTSFORMAT
“如何制定一个高效的期末复习计划?”
“How can I build an effective final-exam study plan?”
AMBIGUITY ↓   ·   TASK SPECIFICATION ↑
INTERPRETUNDERSTAND · JUDGE

VISUAL INPUT

像素 → 判断
Pixels → Judgment
COLORSHAPETEXTUREEDGEOBJECTCONFIDENCE
不同输入,同一个核心问题。结构 → 理解 → 判断 → 输出
作业 01 · 已完成同一个问题的三次提问实验3 条 Prompt · 3 次输出 · 四维比较 · 150+ 字复盘 作业 02 · 已完成不同角色回答同一问题3 组角色 Prompt · 回答节选 · 最有效角色及原因 作业 03 · 已完成计算机视觉应用流程图真实场景 · 完整流程图 · 100 字说明 作业 04 · 已完成两款图像生成 AI 工具对比同一 Prompt · 两张结果图 · 操作证据 · 正式比较
实验 01 · PROMPT 演进

同一个问题,Prompt 如何逐渐变得可控?

How does a vague question become a controllable task?

三轮实验没有改变核心问题,只逐步减少任务中的信息缺失与解释空间。点击三轮观察 Prompt 如何“长出来”,以及输出质量如何同步变化。

The core question stays the same. Only role, context, constraints, format and evaluation criteria are progressively added.

FORMAL SUBMISSION EVIDENCE · 作业 1 提交项

三条 Prompt · 三次整理输出 · 四维比较 · 150 字以上复盘

✓ 3 条 Prompt✓ 3 次输出整理✓ 准确性✓ 条理性✓ 风格匹配度✓ 实用性✓ 150+ 字复盘
ASSIGNMENT 01 · COMPLETE

Prompt Evolution — three prompts, three outputs and a four-metric comparison

ROUND 01 · VAGUE

“How can I build an effective final-exam study plan?” The answer was broadly correct, but lacked user, time and course constraints.

ROUND 02 · CONTEXTUAL

Role, student profile, 14 days, four courses and different mastery levels produced a practical four-stage plan with priorities.

ROUND 03 · VERIFIABLE

Format, length, tone, constraints and evaluation criteria turned the answer into an executable and reviewable specification.

Four-dimensional result

Accuracy 60 → 82 → 96 · Structure 60 → 84 → 98 · Style fit 42 → 80 → 96 · Usability 48 → 84 → 97.

Full reflection

The strongest change across the three rounds was not prompt length by itself, but the progressive removal of ambiguity. Round 01 gave the model only a goal, so it could not know how many courses existed, how much time remained or what counted as a good answer. Round 02 introduced the user, role, schedule and workload, allowing the model to organize a targeted plan. Round 03 also defined the expected structure, length, voice, limits and evaluation criteria. This effectively described the acceptance standard before generation. A strong prompt therefore creates a clear task boundary: what the model must solve, for whom, under which constraints, and what a verifiable result should look like.

REAL CASE|真实案例条件问题:如何制定高效的期末复习计划·14 天·4 门课程·不同掌握程度·同一款文本 AI
ROUND 01|简单模糊提问

PROMPT 01

如何制定一个高效的期末复习计划?

AI 输出整理

  1. 明确考试时间和科目,先整理所有考试日期、科目和复习范围。
  2. 把复习分成基础知识回顾、重点强化和模拟练习三个阶段。
  3. 按照课程难度和个人掌握程度安排每天的学习时间。
  4. 通过练习题、模拟题和历年题主动检测,而不是只阅读资料。
  5. 每隔几天检查进度并调整复习计划。
  6. 保证正常休息与睡眠,避免长期熬夜。

本轮观察

回答整体正确但比较泛化。AI 知道“应该做什么”,却不知道具体对象、课程数量、剩余时间与目标标准,因此难以形成可以直接执行的计划。

ROUND 02|补充身份、任务和对象

PROMPT 02

你是一名大学学习规划顾问。请为一名正在准备期末考试的大学生制定复习方案。该学生需要同时复习 4 门课程,距离第一门考试还有 14 天。不同课程掌握程度不同,希望既能覆盖全部知识,又能重点解决薄弱内容。请给出一套具体、容易执行的复习方法,并说明每天应该如何安排学习重点。

AI 输出整理

Day 1—2|诊断与规划:整理考试日期、范围、章节、历年题,并把知识分成 A 已掌握、B 基本理解但不熟练、C 明显薄弱,后续优先投入 B/C。

Day 3—9|重点强化:每天安排 2—3 门课程;上午处理最高难度课程,下午完成第二重点课程,晚上通过题目、闪卡或口头复述进行检测。采用“学习 → 合上资料回忆 → 做题 → 检查错误”。

Day 10—12|综合练习:减少单纯看书,提高历年题、Tutorial 和模拟题比例,建立错题与薄弱点清单。

Day 13—14|考前收束:集中复习高频考点、错题、核心公式与易混概念,完成一次限时模拟并保证正常睡眠。

本轮观察

加入“大学学习规划顾问、4 门课程、14 天、不同掌握程度”等信息后,答案开始围绕真实约束组织时间轴、课程优先级与每天学习重点,可执行性明显提高。

ROUND 03|明确输出规格与评价标准

PROMPT 03

你是一名擅长学习科学与时间管理的大学学习规划顾问。请为一名距离第一门期末考试还有 14 天、需要同时复习 4 门课程的大学生制定一套可以直接执行的复习计划。不同课程掌握程度不同,因此计划不能简单平均分配时间,而应根据“考试紧迫度 × 课程难度 × 当前薄弱程度”确定优先级。 输出要求: 1. 先用不超过 80 字说明整体复习策略; 2. 将 14 天划分为 4 个阶段,并说明每阶段目标; 3. 提供一个“标准复习日”的时间安排示例; 4. 给出判断课程优先级的方法; 5. 给出每天晚上可以执行的 5 分钟复盘清单; 6. 最后列出 3 个最容易导致复习计划失败的问题及对应解决方法。 表达要求: - 使用清晰的小标题和项目符号; - 语言简洁直接,不使用空泛鼓励; - 不要求每天长时间熬夜; - 不假设所有课程难度相同; - 所有建议必须能够直接执行; - 总长度控制在约 700—900 字。

AI 输出整理

整体策略:先判断每门课程的考试紧迫度、难度与薄弱程度,把更多时间投入高风险课程,通过主动回忆、练习题和模拟考试持续验证效果。

四阶段:Day 1—2 诊断;Day 3—8 核心强化;Day 9—12 练习与查漏;Day 13—14 考前收束。

标准复习日:09:00—11:00 最高优先级课程;11:15—12:00 闭卷回忆与小测;14:00—16:00 第二优先级课程;16:20—17:20 第三门课程快速回顾;19:30—21:00 历年题 / Tutorial / 综合练习;21:00—21:20 整理错误与明日任务。

优先级:依据“考试紧迫度 × 课程难度 × 薄弱程度”动态调整,不平均分配四门课程时间。

5 分钟复盘:今天真正掌握了什么?哪些内容仍无法独立解释?做错了哪些题?哪门课风险最高?明天最重要的三个任务是什么?

失败预案:计划过满 → 每天只保留 3 个核心任务;只看资料不检测 → 每学完一部分就闭卷回忆或做题;平均分配时间 → 每两天重评课程优先级。

本轮观察

第三轮把“什么样的结果才算合格”也写入 Prompt,因此输出从一般建议升级为结构明确、可以直接执行并方便检查的任务方案。

150+ WORD REFLECTION · 实验复盘

提示词优化的核心不是“越长越好”,而是减少任务歧义。

三轮实验最明显的变化,并不是提示词越长,答案就一定越好,而是模型获得的任务信息越来越明确。第一轮只有“制定复习计划”这一目标,AI 虽然能够回答,但不知道对象有多少门课程、距离考试还有多久,也不知道回答最终需要达到什么标准,因此只能输出比较普遍的学习建议。第二轮加入角色、对象、时间和任务条件后,模型开始围绕“14 天、4 门课程、掌握程度不同”等真实约束进行规划,回答的针对性和可执行性明显提高。第三轮进一步规定输出结构、篇幅、语言风格、限制条件和评价标准,相当于提前告诉模型“什么样的答案才算合格”,因此结果更加稳定、清晰,也更方便直接执行和比较。这说明提示词优化的核心并不是堆积复杂术语,而是降低任务中的信息缺失和解释空间。高质量 Prompt 本质上是在建立清晰的任务边界:模型需要解决什么问题、为谁解决、受到哪些限制,以及最终结果应该长什么样。

实验 02 · 角色棱镜

角色不是语气滤镜,而是注意力滤镜。

Role changes attention, not just tone.

同一个问题穿过不同“角色棱镜”后,模型会重新排序什么信息最重要。角色设定改变的是分析视角,而不仅仅是说话方式。

Passing the same question through different role prisms changes what the model prioritizes. A role changes the analytical lens, not only the voice.

同一问题 · 如何制定高效的期末复习计划?
ROLE CHANGES ATTENTION, NOT JUST TONE.
FORMAL SUBMISSION EVIDENCE · 作业 2 提交项

3 组角色 Prompt · 3 段回答节选 · 最有效角色及原因

✓ 3 种身份✓ 3 组 Prompt✓ 3 组回答节选✓ 表达方式比较✓ 建议角度比较✓ 语言风格比较✓ 最有效角色结论
ASSIGNMENT 02 · COMPLETE

Role Prism — one question refracted through three professional lenses

LEARNING ADVISOR

The prompt asks for diagnosis of mastery, course priorities and evidence-based learning methods. The response emphasizes knowledge, method and feedback: learn, retrieve without notes, solve a problem and verify mastery.

TIME MANAGEMENT COACH

The prompt asks for direct execution rules without empty encouragement. The response emphasizes priority, measurable output and three mandatory tasks plus two optional tasks per day.

CAMPUS COUNSELOR

The prompt asks for efficient but sustainable planning without medical diagnosis. The response emphasizes stress, task breakdown, rest and lowering the barrier to action.

Best-fit role: Learning Advisor

All three roles are useful, but the learning advisor best fits the complete task because it answers three questions together: what to learn, how to learn it, and how to prove it has been learned. The experiment shows that a role changes attention, not just tone.

SAME REAL QUESTION|同一真实问题“如何制定高效的期末复习计划?”·仅改变 AI 角色身份与关注视角
ROLE 01 · LEARNING ADVISOR

耐心的大学学习指导老师

PROMPT
你是一名耐心、专业的大学学习指导老师。一名大学生距离期末考试还有 14 天,需要同时准备 4 门课程,而且不同课程掌握程度不同。请回答“应该如何制定高效的期末复习计划?”请重点帮助学生判断知识掌握情况、安排课程优先级,并给出科学的学习方法。语言清晰、耐心,不要只给出“努力学习”“合理安排时间”等空泛建议。
回答节选
“先不要急着制定精确到每小时的时间表,而应该先确定哪些知识真正需要复习……每学完一个知识点后关闭资料,尝试自己解释概念、写出公式或者完成一道相关题目。”
角色影响

重点集中在知识掌握、主动回忆和学习反馈;表达方式耐心、解释充分,教学感最强。

ROLE 02 · TIME COACH

严格的时间管理教练

PROMPT
你是一名严格、强调执行结果的时间管理教练。一名大学生距离期末考试还有 14 天,需要同时准备 4 门课程,而且不同课程掌握程度不同。请回答“应该如何制定高效的期末复习计划?”不要进行长篇安慰,也不要使用空泛鼓励。请直接指出最容易浪费时间的行为,并给出可以立即执行的时间管理规则。语言简洁、有执行压力,但不要刻薄。
回答节选
“不要平均复习四门课程。考试最早、最难、最薄弱的课程必须得到最多时间……每天只设置 3 个必须完成任务 + 2 个可选任务。”
角色影响

重点变为时间利用率、任务完成度和可检查产出;语言更短、更直接、更强调执行。

ROLE 03 · CAMPUS COUNSELOR

温和的校园心理辅导员

PROMPT
你是一名温和、理性的校园心理辅导员。一名大学生距离期末考试还有 14 天,需要同时准备 4 门课程,因为任务较多而感到压力。请回答“应该如何制定高效的期末复习计划?”请在保证学习效率的同时关注压力管理、休息和计划的可持续性。不要过度安慰,也不要给出医学诊断。语言温和、具体,并提供真正可以执行的建议。
回答节选
“把‘我要复习四门课’改成更小的行动……任务越具体,大脑越容易开始行动。同时,不建议通过长期减少睡眠来换取学习时间。”
角色影响

重点转向压力、任务拆解、休息与长期可持续性;语言最温和,强调降低行动阻力。

MOST EFFECTIVE ROLE · 最有效角色

耐心的大学学习指导老师

三种角色都能提供有效建议,但如果目标是完整解决“如何制定高效的期末复习计划”,学习指导老师最合适。原因是期末复习不仅是时间管理问题,还涉及知识掌握程度、课程优先级、学习方法和结果检测。时间管理教练更擅长提高执行效率,但对具体学习方法关注较少;校园心理辅导员能够降低压力并提高计划的可持续性,但学科学习策略相对弱一些。学习指导老师能够同时回答“学什么、怎么学、如何判断是否学会”三个问题,因此信息覆盖最完整,也与任务本身最匹配。

实验 03 · 视觉实验室

让“AI 看图”从流程图变成可操作体验。

Turn computer vision into an explorable experience.

选择场景中的不同物体,观察模型可能关注的视觉特征、识别置信度与垃圾分类结果。完整流程图作为实验说明与证据保留在下方。

Select an object to inspect the visual features, detection confidence and mapped waste category. The full pipeline remains available as formal evidence.

RGB 图像 · 校园垃圾场景目标检测已启用
🧴🍌🔋🥤
已选物体
视觉特征
分类结果
FORMAL SUBMISSION EVIDENCE · 作业 3 提交项

真实案例:校园垃圾分类识别 · 1 张流程图 · 100 字左右说明

✓ 真实生活场景✓ 输入图片✓ AI 关注的信息/特征✓ 视觉任务/算法模块✓ 输出结果✓ 实际应用✓ 100 字说明
ASSIGNMENT 03 · COMPLETE

Campus waste sorting — a complete computer-vision application pipeline

RGB image → visual features → YOLO / image classification → confidence → waste category → smart sorting.

PLASTIC BOTTLE · 96%

Transparent blue color, cylindrical contour, plastic material and cap structure → recyclable.

BANANA PEEL · 93%

Yellow color, curved contour, organic material and surface texture → food waste.

BATTERY · 98%

Black/copper color, cylindrical shape, metal material and terminal structure → hazardous waste.

Formal explanation

This pipeline uses campus waste sorting as a real-life computer-vision scenario. A camera captures the item, after which the system extracts color, shape, material, texture, label and edge information. YOLO object detection and image classification identify the object and estimate confidence. The resulting object label—plastic bottle, banana peel, battery or paper cup—is then mapped to recyclable, food, hazardous or other waste. The final output guides a smart bin, completing the path from visual input to feature extraction, model judgment and practical action.

校园垃圾分类识别流程图
SELECTED REAL-LIFE SCENARIO

校园垃圾分类识别

本案例选择校园场景中最常见、也最容易与计算机视觉结合的任务:通过摄像头识别待投放物品,并判断其对应的垃圾类别。实验中使用的具体物品是:

  • 塑料瓶 → 可回收物
  • 香蕉皮 → 厨余垃圾
  • 电池 → 有害垃圾
  • 纸杯 → 其他垃圾
WORKFLOW REQUIRED BY THE ASSIGNMENT

从“看见图像”到“做出判断”

  • 输入图片:摄像头拍摄待投放垃圾物体。
  • AI 关注的信息/特征:颜色、形状、材质、纹理、标签、边缘轮廓。
  • 视觉任务或算法模块:YOLO 目标检测 + 图像分类。
  • 输出结果:识别出具体物体,并给出置信度。
  • 实际应用:把识别结果映射为垃圾类别,指导智能垃圾桶投放。
AI SAW WHAT? · AI TOLD WHAT?

不是“直接认出物体”,而是“先提取特征,再形成类别判断”

AI 看到了什么:透明材质、圆柱轮廓、黄色弯曲形状、金属端点、杯状结构等视觉特征。

AI 最终告诉人们什么:这是什么物体、识别置信度是多少、应该投放到哪一类垃圾桶。

100 WORD DESCRIPTION · 正式说明

作业 3 提交说明

本流程以“校园垃圾分类识别”为真实生活场景,展示 AI 从获取图像到形成实际判断的完整过程。系统先读取待投放物品的图片,再提取颜色、形状、材质、纹理和边缘等视觉特征,并通过 YOLO 目标检测与图像分类模型判断物体类别,同时输出识别置信度。之后,系统把“塑料瓶、香蕉皮、电池、纸杯”等识别结果映射为“可回收物、厨余垃圾、有害垃圾、其他垃圾”等垃圾分类结果,最终用于智能垃圾桶和校园投放引导,实现从“看见”到“判断”再到“应用”的完整视觉链路。

实验 04 · 模型竞技场

同一段 Prompt,两套生成系统。

SAME PROMPT. TWO GENERATION SYSTEMS.

ChatGPT Image 与豆包 AI 使用相同任务提示词。拖动中间滑杆直接比较两张最终候选图,再展开查看豆包一次生成的四个方向与真实操作证据。

ChatGPT Image and Doubao AI received the same prompt. Drag the divider to compare the selected outputs, then inspect Doubao's four visual directions and process evidence.

Doubao selected output ChatGPT Image selected output CHATGPT IMAGEDOUBAO AI
内容准确性
ChatGPT 96Doubao 84
文字清晰度
9572
排版结构
9486
画面效果
9192
以上评分仅用于本次 Day 13 实验内部比较,不代表官方模型基准。
豆包 · 4 个生成方向
FORMAL SUBMISSION EVIDENCE · 作业 4 提交项

同一段 Prompt · ChatGPT Image vs 豆包 AI · 两张生成图 · 真实操作证据 · 100 字左右比较

✓ 两款真实工具✓ 同一 Prompt✓ 两张最终生成图✓ 豆包操作截图✓ 内容准确性✓ 文字清晰度✓ 排版✓ 画面效果✓ 100 字比较
ASSIGNMENT 04 · COMPLETE

Same prompt, two image-generation systems

Both ChatGPT Image and Doubao AI received the same prompt for a vertical Chinese “Computer Vision Learning Map.” The controlled variables were topic, knowledge modules, Chinese-text requirement and portrait format; the generator was the primary variable.

CONTENT ACCURACY

ChatGPT Image preserved the requested knowledge structure more consistently; Doubao offered broader layout exploration.

TEXT & STRUCTURE

ChatGPT Image produced more stable long-form Chinese text and a clearer process-to-module reading path.

VISUAL QUALITY

Doubao’s four candidates demonstrated strong variation and a cohesive contemporary infographic style.

Formal comparison

Under the same prompt, the two tools organized information differently. ChatGPT Image more completely represented the course structure and visual examples, with clearer separation between classification, detection, YOLO, face recognition and segmentation. Its Chinese labels were also more stable. Doubao’s strength was layout exploration: one run produced four visually distinct directions with a clean modern style. This experiment therefore selects ChatGPT Image for the final learning map because knowledge accuracy, completeness and legibility are the first priorities. The ratings apply only to this Day 13 experiment and are not an official benchmark.

CONTROLLED EXPERIMENT|控制变量主题、知识模块、中文要求、竖版方向保持一致·主要变量:图像生成工具
查看两款工具使用的统一 Prompt
创作一张作品集级别的竖版中文信息图,主题为“计算机视觉学习意图总览图”,英文副标题“COMPUTER VISION LEARNING MAP”。 整体用于总结计算机视觉入门学习内容,采用专业教育信息图和现代科技编辑设计风格。画面需要结构清楚、中文文字清晰、知识关系准确,不使用无意义装饰和随机英文。 完整呈现学习逻辑: 输入图像 → 提取特征 → 识别 / 定位 / 分割 → 输出结果 → 实际应用 核心知识模块包括: 1. 图像分类:判断图片属于哪一类,例如猫狗分类; 2. 目标检测:判断图片中出现什么物体,并找到物体位置,用 Bounding Box 表示; 3. YOLO:一次完成目标定位与类别判断,突出实时目标检测特点; 4. 人脸识别:根据人脸视觉特征进行身份识别或相似度判断; 5. 图像分割:将图像中的不同区域进行像素级区分; 6. 特征提取:展示颜色、边缘、纹理、轮廓和形状等视觉特征; 7. 典型应用场景:自动驾驶、安防监控、智能零售、校园垃圾分类、医疗影像、门禁系统。 同时设置“AI 看到了什么?”与“AI 最终做什么?”两个总结区域。要求中文文字完整、清晰、可阅读,使用专业信息图网格系统,保持足够留白,不出现乱码,不加入与计算机视觉无关的元素。
ChatGPT ImageFINAL SELECTED OUTPUT
ChatGPT Image 计算机视觉学习意图总览图
豆包 AISELECTED FROM 4 DIRECTIONS
豆包 AI 计算机视觉学习意图总览图
评价维度
ChatGPT Image
豆包 AI
内容准确性
核心知识覆盖完整,概念与视觉案例对应较稳定。
总体结构正确,但候选方案中存在模块缺失、错位或重复。
文字清晰度
标题、模块名及主要解释文字整体可读性更稳定。
短标题表现较好,长中文正文中出现字符异常与内容错位。
排版结构
“总流程 → 核心模块 → 总结”的阅读路径明确。
一次提供多种版式探索,视觉方向更丰富,但知识关系稳定性略弱。
画面效果
真实视觉案例更多,计算机视觉任务更直观。
卡片化与渐变视觉统一,现代课程信息图感较强。
~100 WORD COMPARISON · 正式比较结论

相同 Prompt,并不会得到相同的信息组织方式。

在完全相同的提示词下,ChatGPT Image 与豆包 AI 呈现出明显不同的生成特点。ChatGPT Image 对课程知识结构和视觉案例的还原更完整,图像分类、目标检测、YOLO、人脸识别和图像分割等模块之间区分清楚,中文文字也更加稳定。豆包的优势主要体现在版式探索,一次生成了四种不同的信息图结构,整体设计简洁现代,但部分方案存在知识缺失、文字错位和字符异常。说明评价图像生成结果不能只看画面是否美观,还需要同时检查内容准确性、文字可读性、信息结构与任务适配度。

模型选择 · 为什么选择它?

不是“哪一个模型更好”,而是“哪一个更适合当前任务”。

The better model is the one that fits the task.

01 · 知识准确性
02 · 完整性
03 · 可读性
04 · 结构
05 · 视觉质量
FINAL LEARNING MAP

ChatGPT Image

对于“课程知识总览图”,知识准确性、完整性与文字可读性优先于视觉装饰。ChatGPT Image 对七个核心模块覆盖更完整,并用目标检测、人脸识别、图像分割等真实视觉案例帮助理解。

For a course learning map, accuracy, completeness and legibility matter before decoration. ChatGPT Image better preserved the full knowledge structure and visual examples.

DOUBAO STRENGTH · LAYOUT EXPLORATION
综合总结 · 四个实验背后的一条规律

LANGUAGE

WORDSCONTEXTCONSTRAINTSINTENT
→ ◎ ←

VISION

PIXELSFEATURESOBJECTSRELATIONS

AI DOES NOT SIMPLY RECEIVE INFORMATION.
IT INTERPRETS STRUCTURED SIGNALS.

真正影响 AI 输出质量的,不只是模型能力,还有输入是否被组织成模型能够理解、判断和验证的信息。

Output quality depends not only on model capability, but also on whether input is organized into signals the model can interpret, judge and verify.