布里吉斯

思考,不要说话

拼贴风格的艺术作品:一双手正在一台老式打字机的键盘上敲击,打字机上方升起五条边缘呈撕裂状的垂直色带,颜色依次为蓝色、橙色、绿色、粉红和黄色。打字机与双手为黑白色调,背景纯白并点缀黑色墨点飞溅。

Read this in English

逝去的TNT之后,最近,语音输入又引发了一轮讨论。这次是以Typeless为首的语音输入工具开始的。它们宣称可以令用户通过说话的方式做到完美文本输出。Typeless还在其官网插入了一个「宣言」页面,信誓旦旦地宣称「语音才是人类的原生输入方式(Voice is our default)」,以此来衬托Typeless的革命性。

传统的语音输入不尽如人意的重要原因,是因为算法通常会忠实转写语音中的所有文字。例如,我们在说话的时候会有停顿、或者「嘴比脑子快」的情况,算法会不假思索地将它们输出到结果里。而像是Typeless和Wispr Flow这类新型语音输入工具,它们会将转写结果交给大语言模型「转」一轮,移除「嗯啊是哎」这类口水词,然后理解「啊,不是,刚才说的应该是……」这类替换词的指令,再经过一轮打磨,最终输出到输入框中。

我第一次看到这个演示的时候,是在朋友的手机上看到的。当时他向我演示了在ChatGPT app中,用自然语言的方式组织了一个很长的提示词,基本上也是想到什么说什么。从表面上来看,最终的转写结果非常干净利落:Typeless不仅将口水词全部移除,还稍微打磨了一下输出。在这几个月的群聊交流中,很多群友都对Typeless有着不少的溢美之词。

看着很美好,但当我尝试自己使用Typeless,发现实际体验和想象中完全是南辕北辙的。首先是「打扰」的问题。对我来说,使用Typeless最好的场景是和别人聊天,但在这种场景下,物理上我有可能和其他人在一起。在其他无关人士在场的情况下,语音聊天会让我觉得有点「不会读空气」。(传说Typeless有个低语模式,但我也没有实际体验过,因此也不好做出评价。)

「打扰」这个事情,再怎么说也算是可以「用户自适应」的缺陷:如果必须要在公共场合使用,顶多换一个没人的地方,或者用手遮挡一下就好。真正让我对Typeless敬而远之的一点是,我觉得Typeless这类语音输入工具,正在剥夺我的思考流程。

没错,如果你的输入非常集中在「快速回复」这一点上,Typeless的确能为你提升不少的效率。我们群组中有一位律师朋友十分中意Typeless,因为他需要快速回复客户的问题,而且因为涉及法律专业意见,因此每位客户的问题都需要十分详尽的回复。这时候,Typeless可以在极短的时间内输出合理且专业的回复,是一个极为合理的选择。

但我不一样。除了聊天,我目前阶段很大一块的精力都在内容输出上。自从上一次尝试让LLM主导写作(并且获得了并不愉快的体验)之后,我至今都坚持自己主导内容撰写和输出的工作。期间可能会用到LLM,但最多就是帮我检查病句、错别字,或是整理思路(例如这篇)。

无论是Typeless还是Wispr Flow,他们的营销都希望让你无脑地相信,「因为说话比打字快,所以说话是一个更好的输入方式」。Wispr Flow甚至还推出了一个打字比赛,如果你的打字速度超过说话的速度,你就可以赢走一辆保时捷汽车。而这种打字比赛通常的流程,是通过一段相同且固定的文本,测试键盘输入和语音输入速度。

但问题是,至少在我写这篇文章的时候,所有内容的撰写和创作都是需要经过推敲的。对我来说,一个典型的撰写过程类似这样:首先我需要思考「这句话应该怎么表达」,然后打出来。发现一些用词不太准确,触摸板选中不合适的词,移除,考虑一下哪个词更合理。有时候写到一半,又返回去看写过的东西——「这里能用一个成语概括」、「这个句子似乎是病句」、「这里表达是不是不太准确」…… 这些思考不一而足。当我写完一篇初稿,还需要花费时间从头阅读到尾,看看哪里还有不尽如人意之处,然后再单独修改。

所以,这些「革命性的」语音输入app们所营销的「说话比打字快」这一点,(至少在文本创作领域)是根本不成立的,因为正常的文字内容创作速度要比比赛中对着文本打字还要慢上不少。换句话说,创作本就不是一个「速度为先」的行为。而打字,本质上是一个思考的过程:我先输入这些词句,通读一次,看看它到底合不合适;而非用一个线性、无法回溯修改的表达过程,用「不对,应该是」这样的词句来强行中断思考并修正错误。

前两天,我在Telegram上要和别人分享一段话,并加上自己的附注。由于Telegram macOS客户端对于弹出输入框的一个bug,使用带buffer的中文输入法输入内容会导致乱码。慌乱之下,我只能使用Typeless输入。然后我就陷入了30秒的地狱之中:对着Typeless说话,我不仅多次说出「呃,那个」这些口水词,而且说话的错误频出。最终,Tpeless几乎无法在输入框中从我混沌的语言中润色出合理的句子。我只能从其他记事簿app中输入好附注,然后再粘贴进去。

所以,至少对于我和我的创作流程而言,打字和说话根本不是二选一的选择:创作是一种脑力劳动,而语音输入正尝试剥夺我的思考过程、强迫我将这个过程外包,我自然并不认为语音输入是比键盘输入更好的选择。从这个角度而言,无论是Typeless美其名曰「宣言」的营销材料,还是Wispr Flow的打字比赛,都是忽略了创作的实际内核的空中楼阁。

我有个朋友向我分享了《美国讲稿》的一个片段。我没有读过这本书,但我觉得这一段十分精确地归纳了我的一部分创作论:「因为我认为人们在使用语言时习惯于一般化且随心所欲或漫不经心,对此我却不能容忍。请不要把我的反感说成是我不能容忍我的同胞。不,我最不能容忍的是听我自己讲话。因此,我尽量少开口讲话,宁愿用手写。因为写的时候我可以多次修改,不能说一直改到我对自己的言语满意时为止,至少可以改得令我看不出有什么不满意的理由。文学——我指的是名副其实的文学——是一片乐土,只有在这片乐土上语言才会现出本来的面貌。」

题图来自Getty Images / Unsplash+

#写作 #创作 #表达 #语音输入