越不合理的需求,越值得去做

这是用语音输入写成的文章

做产品的时候,我发现自己有一个坏习惯:用户提了一个「不合理」的需求,我第一反应就是振振有词地说不,然后把理由说得头头是道。

但有的时候那个需求会一直萦绕在脑子里面,挥之不去,直到我真的想清楚了,才发现——哦,原来这是个完美的产品需求。我说不做,不是因为需求不合理,是因为我做起来太难。

我在做 VoiceDrop 的时候,遇到了三个这样的例子。

第一个:把多段录音合并成一篇文章。

有用户在公众号留言问:能不能录两段或者三段,让 app 自动合并成一篇?

我当时的反应是:这也太复杂了,要选哪几篇,要有编辑界面,界面会变得极难用。建议你用 skill 自己去 Claude 里面搞吧。

过了一段时间,我忽然意识到,这个需求不是很正常吗?现在新版本已经支持了。你直接在任何一篇文章里面跟它说「把这篇文章后面的两篇合并进来」,它就自动合并,还做润色,三篇文章浑然天成。

第二个:语音编辑文章。

另外一个非技术用户提了一个需求。

用语音生成文章之后,在手机上做编辑是一件很痛苦的事情。为什么不能用语音来编辑?

我第一反应也是不做。原因是:定位太难。你怎么精确地描述在什么地方加什么话,把哪一张图具体要挪在什么位置——用语言描述这些,会变得很困难且不自然。

两天以后,我逼着自己想出了办法——<span style="color:red">只要在段落前面加行号,在图片上面标图一、图二、图三,问题就解决了。</span>你直接跟大语言模型说「把第二张图片放到第五行后面」,或者「把第七行里面的我们改成我」,精准无比。

这是我第一次用到真正可用的语音改文章——改到一字不差,没有一丝不合理,直接发布。

第三个:图片功能。

这个是我最斩钉截铁地说不做的。我做的是语音和文字,图片放哪里?世界上又不缺别的图片发布工具。理由说了一大堆。

但当我真的把图片功能做出来,就等于说一边说话,一边屏幕上显示摄像头,你可以看图说话,一边看着这张图解释它,一边拍一张照片。图缺省就放在你当时说话的那个位置。以后还可以让大语言模型根据图的内容,把它放到文章里最合适的位置。

这些加在一起,让我爱不释手,半夜跑到街上,一边走一边说话——写文章的体验好到再也不需要考虑编排的问题了。

---

这让我想起苹果那个跨电脑拷贝粘贴的功能。从几十年前开始,不懂电脑的人第一反应就是:我能不能在这台电脑上 copy,在另一台电脑上粘贴?

我花了多少时间跟一个一个人解释:这是这套系统,那是那个系统,它们之间没有相连,这是不可能的。

直到苹果用 iCloud、蓝牙和本地连接框架把这件事做出来了。框架一旦有了,不只是跨设备粘贴,手机上收到的短消息在电脑上也能收到——所有以前认为不可能的奇怪东西,就自然变成可能了。

还有 iPhone 第一版没有键盘。在屏幕上做多点触控、让模拟键盘有真实键盘的感觉、性能不卡顿——这是技术难题,但你不能否认人的需求就是「一个没有键盘的手机」。

Google 搜索框随便输个词就出结果,这不是一个正常人想要的东西吗?只有专业人士才知道后面有多难,才知道做了多少工作,才让用户觉得「互联网不就应该是这样子吗」。

<span style="color:red">专业人士只会给非专业人士做科普,告诉他为什么这是做不了的。但社会不是这样进步的。</span>大家不满足于清楚地知道为什么不能这么做,大家只想糊里糊涂地这么做下去。

it work 不是最低标准,这是我们整个世界的最高标准。如果一个东西 work,你还期待他干有一些其他的功能吗?

---

我听说过一个心法,觉得很有用:

每当出现你认为不应该做的需求,把问题换一个角度——如果是另外一个人把这个功能做出来,你觉得好不好?

很多时候,答案就从否变成了是。

家门口有座山,让愚公去挖,好不好?当然好,这样就可以直接过去了。你让我挖呢?世世代代挖多少代,我不干。

去火星好不好?那里太冷,去了必死,不好。如果让马斯克做出一个东西让我们安全去火星呢?那当然好了,希望他尽快做出来,且在我有生之年让平民到达火星的梦想变成现实。

所以,先想「如果别人做出来,你会不会喜欢」。如果是,再去思考那个困难的问题到底怎么做出来。对于这个问题,不见得总有答案,但至少值得思考。

不要那么快说不。即便说了不,也要让这个需求在脑子里面沉淀,反反复复地去检验——到底是这个需求不合理,还是我做不出来?