最近自己做了一个 AI 图片产品:
它目前最核心的能力,是把照片快速生成成草图、线稿、线描风格的图片。
但我其实不太想把它定义成一个单纯的「 Photo to Line Drawing 」工具,也不希望它只是另一个 AI Image Generator 。
我更希望它最终变成一个:
一站式的图片 Agent 。
你不需要学习 Prompt ,不需要研究模型,也不需要反复在不同 AI 网站之间切换。
你只需要告诉它你想做什么,剩下的事情交给 AI 。
为什么最开始选择「草图 / 线稿」这个方向?
这两年 AI 生图工具很多。
但我自己真正去用的时候,经常会遇到一个问题:
大部分 AI 图片产品,本质上还是在让用户“操作模型”。
打开一个网站之后,第一件事通常是:
Please enter your prompt.
然后还有一堆参数:
- Model
- Style
- CFG
- Steps
- Aspect Ratio
- Negative Prompt
- Seed
对于 AI 玩家来说,这些东西可能很有意思。
但对于大部分普通用户来说,他们其实根本不关心这些。
比如一个用户想把自己的照片转换成线稿。
他的需求其实非常明确:
我就想把这张照片变成一张好看的线稿。
他并不想研究:
“high quality pencil sketch, clean line art, monochrome, detailed contour, white background...”
所以我开始想:
AI 图片工具为什么一定要让用户写 Prompt ?
于是 formind 最开始选择了一个非常具体的场景:
Photo → Line Drawing / Sketch
上传一张图片,直接生成。
没有 Prompt 。
没有复杂参数。
不用知道背后是什么模型。
但做着做着,我发现「生成一次」其实远远不够
这是我后来对这个产品最大的认知变化。
最开始我的产品逻辑很简单:
上传图片 → AI 生成线稿 → 下载。
听起来没什么问题。
但真正使用之后,会发现用户很少第一次就完全满意。
比如生成之后你可能会觉得:
- 线条太复杂了
- 想简单一点
- 人脸细节不够像
- 背景不想要
- 想只保留人物
- 想变成更像铅笔画
- 想改成漫画线稿
- 某个地方生成错了
- 想把某个元素删掉
- 想换一个风格
传统 AI 工具的解决方案通常是:
重新写 Prompt ,再生成一次。
但我觉得这个交互方式其实很反人类。
因为真实世界里,我们和设计师沟通也不会这样。
你不会每次都重新写一份完整需求。
你可能只是说:
“这里简单一点。”
“背景去掉。”
“人物保留,线条再干净一些。”
“这个地方不太对,再改一下。”
所以我开始觉得:
AI 图片产品真正应该做的,不是“一次生成”,而是“持续修改”。
所以我现在更愿意把 formind 定义成「 Image Agent 」
我的理想交互其实非常简单。
比如你上传一张照片。
先生成一张线稿。
如果不满意,可以直接继续修改:
线条简单一点。
然后:
去掉背景。
然后:
保留头发细节。
然后:
改成适合小朋友涂色的线稿。
然后:
还是太复杂,再简单一点。
AI 应该知道:
你是在修改刚才那张图片。
而不是每一次都让你重新上传、重新描述、重新生成。
这也是我觉得 Image Agent 和普通 AI Image Generator 最大的区别。
普通生图工具更像:
Prompt → Image
我希望 formind 最终变成:
Image → Edit → Edit → Edit → Final Result
或者更准确一点:
Idea → Agent → Result
我越来越觉得,Prompt 可能只是 AI 产品的一个过渡阶段
现在很多 AI 产品都在强调 Prompt 。
甚至出现了 Prompt Engineering 。
但站在普通用户的角度,我其实一直觉得这件事情有点奇怪。
比如我使用 Photoshop 的时候,我不需要先学习:
“如何正确描述我要删除背景。”
我只需要点击 Remove Background 。
AI 应该让软件变得更简单,而不是让用户学习一种新的“编程语言”。
所以 formind 现在有一个比较明确的产品原则:
能不让用户写 Prompt ,就尽量不让用户写 Prompt 。
比如:
照片 → 线稿
照片 → 草图
去背景
删除人物
删除物体
增强画质
扩图
头像
证件照
这些需求,本身就是 Prompt 。
用户点击「 Photo to Line Drawing 」的时候,其实已经告诉系统他想干什么了。
剩下的 Prompt 、模型选择、参数、工作流,我觉得都应该交给产品完成。
未来我想做的其实不是 100 个 AI 小工具
现在市面上有很多 AI Tool 网站。
首页可能放着:
AI Image Generator Remove Background Image Enhancer Remove Object AI Avatar Photo to Anime Photo to Sketch ……
一眼看过去有几十个工具。
formind 现在也有一些类似能力。
但我后来越来越觉得:
如果只是把 100 个 AI 工具放在一起,它依然只是一个工具箱。
我真正想做的是把这些能力连接起来。
举个例子。
你上传一张照片,说:
我想把它做成一本儿童涂色书里面的插画。
Agent 可以自动完成:
照片识别 ↓ 删除复杂背景 ↓ 人物主体提取 ↓ 转换线稿 ↓ 降低线条复杂度 ↓ 增强轮廓 ↓ 输出适合打印的图片
用户不需要知道这里用了几个模型。
甚至不需要知道中间发生了什么。
他只需要看到最后的结果。
这才是我理解的一站式 Image Agent 。
为什么我还是选择从「线稿」开始?
因为我觉得做 AI 产品很容易掉进一个坑:
什么都想做。
AI 生图可以做。
AI 编辑可以做。
换脸可以做。
头像可以做。
商品图可以做。
视频也可以做。
如果一开始就做一个“万能 AI 图片平台”,其实用户很难理解:
你到底解决什么问题?
所以 formind 目前还是会把:
Photo to Line Drawing / Sketch
作为最核心的入口。
先把一个非常具体的需求做好。
包括:
- 人像转线稿
- 宠物转线稿
- 建筑转线稿
- 产品转线稿
- 照片转铅笔画
- 照片转 Coloring Page
- 图片转漫画线稿
但是在线稿生成完成之后,希望用户不要停在这里。
而是可以继续和 Agent 沟通、修改、生成,直到最终得到自己真正想要的结果。
做这个产品之后,我现在最大的思考
以前我觉得 AI 图片产品竞争的是:
谁的模型效果更好。
现在越来越觉得不是。
因为模型会快速迭代。
今天某个模型领先,几个月之后可能又换一个。
如果你的产品价值只是:
“我接入了最新的 XX 模型。”
这个优势其实非常短暂。
我现在更关注的是另外几个问题:
1. 用户能不能不用学习 Prompt ?
2. 用户第一次生成不满意之后,能不能很自然地继续修改?
3. AI 能不能理解当前图片和之前的修改历史?
4. 产品能不能自动决定应该调用哪个模型、哪个工具?
5. 用户最终关心的是“模型”,还是“结果”?
我自己的答案越来越倾向于:
用户根本不应该关心模型。
模型最终应该像数据库、CDN 、云服务器一样,变成底层基础设施。
用户只需要说:
我想要这个。
然后 Agent 帮他完成。
目前 formind 还在比较早期的阶段。
核心方向是:
Photo to Line Drawing / Sketch + Image Agent
如果 V2EX 有做 AI 、独立开发、设计或者图片产品的朋友,欢迎试一下。
我现在尤其想听听大家对一个问题的看法:
你觉得未来 AI 图片产品的主要交互方式,会继续是 Prompt → Image ,还是会逐渐变成类似 Agent 一样,围绕一张图片不断沟通和修改?
另外也非常欢迎直接吐槽产品。
如果你打开网站之后 30 秒就关掉了,我其实更想知道:
是什么让你决定关掉它?
这个反馈可能比“支持一下”对我更有价值。