Tu Tech
基于 ESP32 小智机器人打造“赛博户子”:硬件选购、刷固件、声音克隆与人设定制,全程用自然语言指挥 AI 完成的 DIY 教程。
文章信息
发布日期
2026.8.8
作者
TuTu
话题
户晨风机器人AIESP32声音克隆教程
摘要
基于 ESP32 小智机器人打造“赛博户子”:硬件选购、刷固件、声音克隆与人设定制,全程用自然语言指挥 AI 完成的 DIY 教程。

赛博户子(户晨风AI对话机器人)简易AI教程分享

2026.8.8 · TuTu

我用AI制作的网页:户晨风数字纪念馆

赛博户子(户晨风机器人) 是一个苹果级别的项目,让你的ESP32设备变户晨风本人,OpenClaw负责从物理层操纵Macmini来对“固件”或“服务”做出调试或修改。你只需动动嘴,一个声音几乎完美还原,能讲“苹果安卓论”的AI户子就诞生了~~

有一些朋友可能很好奇,它到底是怎么做的,有什么坑有什么难点,在这里简单写一下……其实,你只需要购买相应的硬件,再不断向AI提供所需的教程链接,完全让AI来学习如何制作就可以了,整个流程你只需要用自然语言来发号施令、指明方向。

(以下内容包括语音转文本口述和AI撰写的内容)

硬件购买:

首先,它是基于小智机器人来进行修改的,这已经是网上一个非常成熟的硬件/服务了。在淘宝上最低几十元都能买到一个这样的对话机器人,网上也有很多关于它的视频,非常厉害且有趣。

它默认接入小智的服务器:https://xiaozhi.me/ 基本上都调用的是国产大模型和豆包的语音服务。

但是,只是接入小智的官方服务实现不了我们想要的——就是发出户晨风的声音,保持户晨风的人设,甚至使用海外大模型(因为可能会谈到一些敏感话题)的需求。

所以制作户晨风机器人的第一步,就是要买一个可以自己方便刷固件的ESP32设备。而且必须同时带屏幕、话筒喇叭效果优质等。这一步开始你就可以把你的需求描述给AI,让AI来帮你挑选硬件。AI一般会推荐些不错的选择。

我买的一款就是AI首先推荐的,价格并不低,要接近三百人民币。但好在它又不是一次性的设备,如果你以后对户子机器人没兴趣了,你也可以把它刷回原版的或者再修改其他的功能。

对这个设备的改动其实分固件和服务。固件部分复杂得多,我们可以理解成路由器刷机,这其中涉及很多核心代码操作,如果没有代码能力其实是很难,必须全部依托AI来完成。至于到底用哪家的模型(OpenClaw主模型)来做这样的工作,我觉得各有各的习惯,各有各的选择吧,也争不出个所以然。

模型的选择:

我自己是用的Claude,我不认为它一定是最强的,但我觉得它在对话上很能懂我的意图,所以在沟通成本方面倒是节省了很多。 当然,你可以用Claude来做主控AI,然后把代码部分的工作交给更便宜国产大模型(subagent)。

一开始把所有觉得能用的资源都喂给AI。它会判断哪一些是可用的资源。但它最初就把这个知名的项目排除掉了,觉得项目的文本量太大了,如果要进行向量模型训练的话,可能要数周的时间。所以我也就没有把这个知名的项目给加进去。

知名项目:https://github.com/Olcmyk/HuChenFeng

我买的这台ESP32-S3-BOX设备它就提供了非常详细的在线版本的说明书。你直接把它丢给AI就行,AI看过后它就完全懂这是什么设备了,它可以直接开始进行搭建服务/修改固件的工作了。

说明书在线链接

根据AI的解释,它的整个修改流程是这样的:(其实固件方面是零改动,但我后面会解释为什么AI实际上花了不少时间在固件改动上)

ESP32设备用USB线插到Mac mini上的时候,然后就可以和OpenClaw开始真正意义上的修改工作了。这个时候它会自动根据你现有的环境来部署一个开发环境,然后它好像选择了这个:ESP-IDF。(AI对此的解释是这样的。)

具体我也不是很懂,但这就是我想强调的OpenClaw的强大,因为它可以把AI直接引入到物理层级。以前的话,如果只是一个对话窗口,或者像Claude Code这样的终端窗口,我觉得是完成不了这种复杂工作的。

不过,整个项目做下来耗费了我很多token,就连100美元/月的Cloud Max订阅都不够用了。可能是因为我不懂技术,有时候一个想法要用很多的文本去描述,然后AI才能理解。这个沟通过程就花费了很多的token成本。

过程自然不是非常顺畅的。我也遇到了三个坑~

第一个坑是:不要轻易去修改唤醒词。

小智设备的默认唤醒词是“小智小智”、“你好小智”。 然后它还允许修改成英文的、日文的以及一些非常用的词汇,但这些唤醒词都是提前配置好的,使用了可能上百人的声音进行训练。

我一开始不懂这个概念,所以就想让它强行换成“户子户子”或者“户晨风”。 结果AI捣鼓了几小时吧,花了大量的token,都没有成功,因为这个要替换底层的唤醒词其实是非常复杂的。 最后呢,我就让它换成了“Hi~ESP”。 (这也是为什么我没有在视频里录下把它唤醒的过程,因为叫“ESP”实在是太不户子了。 )

如果避开了第一个坑,那其实就是“不改固件”了,整个项目的难度大概降低了超过一半吧。

默认情况下,如果购买的支持小智AI的设备且刷了小智的固件,那么就要连它们的官方服务器。但因为我们对话有很多自定义的要求,所以这个服务端就必须要我们自行部署,比如部署在本地。而这一部分呢,就是真正要涉及到自定义了。

小智的服务器是开源的,也就意味着任何人都可以下载部署服务端并进行自己的修改。 开源的服务:https://github.com/xinnan-tech/xiaozhi-esp32-server

如果你自己有一台NAS,你就要想一下这个小智服务到底是部署在NAS上,还是就放在Macmini本地。当时我也犹豫了一下但AI建议我还是暂时放在 Macmini上面,因为它说在本地的话它就比较好调试,做修改就比较简单。但如果你想要长期运行,可能还是放NAS比较好。 (当然也要确定你的NAS能不能跑本地语音识别的模型)

如果用自然语言表达的话,大概就是这样给AI下命令:

我想在 Mac Mini M4 Pro 上部署小智语音助手的服务器端。项目地址:https://github.com/xinnan-tech/xiaozhi-esp32-server 我的需求:1.用你认为合适的方式部署,方便管理 2.语音识别考虑用本地 3.语音合成要考虑云端,我想用别人训练的声音 4.ESP32通过部署好的这个本地服务连接,配置方面请告诉我要填什么

最终它帮我安装了这个版本的,好像没有装Docker版本:

等把部署好了,AI会发给你一个这样的地址。你需要在你的小智设备初始化的时候,把这个自定义的OTA地址填进去,也就要不再使用官方的那个。

使用OpenClaw给设备刷入小智固件后,首次运行的时候需要连接家里的Wi-Fi,这个时候会有一个网络初始化过程。在网络初始化的地方可以填写自定义OTA地址,既然我们已经自己部署了,所以要填我们自定义的地址。如果是局域网使用,那就填这个内网IP地址就可以了。如果你想要在公网可用,那你就可能还需要做一个内网穿透之类的操作,具体可以问问AI怎么设置。

(连家里Wi-Fi和自定义OTA地址这个步骤不是很复杂。比如说你会在手机上找到一个无密码的Wi-Fi,点开后,它就会要求你连接你的家用Wi-Fi并输入密码。在这个地方的时候窗口上面就有一个切换选项,你可以切过去,把OTA地址填成自己的。抱歉这里我没有截图,但不是很复杂。 )

接下来的工作虽然更复杂,但几乎全部都是AI完成的,也就不用我们再做干预了,保持你的设备和Macmini有线连接,在聊天APP上持续与对方对话,提出你的要求。

第二个坑是:认真考虑到底使用什么ASR服务。

我们要和机器人对话大概是这样的一个流程:先有一个语音转文本的服务,当我们把话说给机器人的时候,它会把我们的语音转成文本(又叫做ASR服务)并简单整理然后就发给AI,由AI来根据这个文本生成回复。然后再用一个文本转语音的服务(又叫做TTS服务),变成声音播给我们听,大概就是这么一个流程。

小智默认的是那个豆包语音(就是火山大模型),所以AI会指导你去注册一个豆包语音的账号,拿到一个API,然后把这个API写进服务端。这样这个服务就会与你的账号进行绑定,并启用语音识别功能。 我想说的是,虽然这些语音识别软件非常好用,识别率也非常高,包括我平时视频生成字幕也用的这个,但它与你的实名账号是绑定的。

当然做户晨风机器人也还好,但如果你想做一个其他输出内容更夸张的机器人的话……总之你要考虑这个风险。一开始呢,我就是用豆包语音,结合Chat的GPT来聊的,其实聊了挺多,也是无所顾忌,各种奇奇怪怪的问题都问,而且我也没有发现有明显的内容审查。但是后来我突然想到这个问题了,然后我就问AI,AI就说还是建议我用那个本地模型,而且它说我的Macmini配置也足够,也给出了一些理由和实践方法。

以下是AI写的解释:

**用的是什么:**用的本地语音识别方案是FunASR框架配合SenseVoiceSmall模型。FunASR是阿里达摩院开源的语音识别工具包,SenseVoiceSmall 是专门为实时场景优化的轻量级模型,支持中文、英文和粤语,还能识别笑声、咳嗽这类非语言声音。**好处是什么:**最大的好处是延迟低和隐私安全——语音不出本机,识别在几十毫秒内完成,比云端省掉了网络往返的时间。其次是没有后续费用,不像云端ASR按调用次数收钱。另外它对中文口语、语气词的处理比较自然,不会把"嗯"、"那个"这种词漏掉或者乱断句。

**性能要求:**SenseVoiceSmall 是轻量模型,对硬件要求不高。在Mac Mini M4 Pro上运行完全没压力,CPU占用很低,内存占用大概几百MB。如果普通PC,有个中等配置的CPU就能跑,不需要显卡。真正吃资源的是后面的大语言模型,ASR这一步反而是最轻松的。

于是我就接受了AI的建议,在本地部署了ASR服务,这些部分也都是AI完成的。只是相比于用在线ASR服务,肯定就多了一些设置步骤,当然整个调试的过程还是出过几次差错——比如说机器人突然就没办法说话了,或者刚一唤醒就会死机,反正就不停的让它调来调去,整个过程也挺繁琐的。所幸它没有去整个改动系统的框架,也没出什么不可逆问题,最终也就OK了。

所以说这点严格来说不是一个坑,而是一个你需要考虑的工具/安全策略。你是倾向于使用云服务,还是更喜欢本地服务?使用云服务的话基本上是不用设置的。使用本地服务的话,可能就要花一点时间进行部署和调试。

集成难点: 小智服务器支持多种ASR后端,配置文件里要同时写好所有选项的参数,然后在 selected_module 里指定用哪个——这个结构一开始容易搞混,改错地方就不生效。FunASR本身需要下载模型文件到本地的 models/SenseVoiceSmall 目录,路径配错或者模型文件不完整都会启动失败,而且报错信息有时候不够直观,需要自己去排查是网络问题还是路径问题。调参经验: 最关键的参数是 end_window_size,它决定了"用户停顿多久算说完"。设太短会把一句话切成两半,设太长用户就要干等,体验很差。我们最后调到250毫秒,在"响应快"和"不误切"之间取得了平衡。另外音频格式也要注意,小智设备发送的是 Opus 编码,服务端要能正确解码成PCM再喂给ASR,这中间如果采样率或声道数对不上,识别结果就会变成乱码或者空白。

踩过的坑: 一开始我们用的是Docker部署的Go版服务器,配置了云端ASR,后来切换到Python版才用上本地FunASR。两个版本的配置文件格式略有不同,路径也不一样,调试的时候改错了文件却发现"怎么改都没效果",排查了半天才发现改的是没在运行的那个。教训就是:先确认当前跑的到底是哪个服务、读的是哪个配置文件,再动手改。

第三个坑是:进行声音的自训练其实是很难的,效果也不够理想。

一开始我把这个地址分享给了AI,因为这是一个网友训练好的声音模型:https://huggingface.co/HappyDIY/HuChenfeng

AI当时就很兴奋地说,用这个已经训练好的模型,肯定效果会非常好嘛。然后设置也很简单,还跟我打保票说很容易就设置好了,说语音服务能可以部署在本地,并采用了GPT-SoVITS这个方案。这个页面还展示了它采用的一些音频样本:

https://huggingface.co/HappyDIY/HuChenfeng/tree/main

这个AI调了很久,调出来的一个效果让我非常不满意,就是音质非常差,然后听起来根本就不像户子本人的声音,完全像另一个人了,让AI改了好几个版本还是不像。当然,如果我不是为了搞这个赛博户子bot,可能就接受这个声音效果了。但是正因为我是要玩整活,声音必须得很像户子本人,所以我就让AI换一个音质更好的方案。

然后它就换用了这个方案:FishSpeech,同样是本地部署的一个文字转语音方案。这个很具体原理我不太懂,但其实它有一个声音克隆的功能。你只需要提供一段户晨风的优质语音给它,然后它就可以直接克隆生成出来。整体而言,它的效果好了很多,已经和户晨风的声音几乎没有什么区别了。但又出现了回复延迟的问题,就是每次我说完话之后,机器人的回答总像是慢半拍。如果我中途再提问,它有时还会继续回答之前的问题。

以下是AI写的分析:

声音方案的演变: 一开始用的是GPT-SoVITS,调用了一个网友训练好的户晨风声音模型,用他的一段原声音频作为参考(就是那句"你看我这个脑子啊,真的是服了")。效果能出声,但总觉得不够像,音色有点闷,而且生成速度偏慢,整体体验差强人意。后来换成了FishSpeech本地部署,跑在Mac mini上,音质有改善,但配置过程比较折腾——模型版本要和代码版本严格匹配(必须用 v1.5.1 配合 firefly_gan_vq decoder),torch 版本也有讲究,踩了不少坑才跑通。最后为了省心,干脆切到了Fish Audio的云服务,直接调用 API,用他们平台上已经训练好的声音模型,效果最稳定、延迟也可接受,就是每次调用要花一点钱。现在的架构是:小智服务器把文字发给TTS Adapter,Adapter调用Fish Audio云端生成语音,再加 6 分贝音量增益返回给设备播放。延迟问题的分析: FishSpeech本地部署后,声音的逼真程度其实已经很不错了,但在实际对话中总有一种"慢半拍"的感觉——说完话,等个一两秒才听到回复,这个体感比云端反而更差。这和Mac mini的配置关系不大,问题主要出在两方面:一是FishSpeech在Apple Silicon上的推理优化还不够成熟,MPS(Metal 加速)跑起来没有 NVIDIA CUDA 那么高效;二是本地部署每次请求都是"冷启动"式处理,而Fish Audio云端有专门的推理集群,模型常驻显存、并行处理,单次请求的生成速度反而比本地快。这就出现了一个反直觉的现象:云端虽然多了网络往返,但总延迟反而更低。所以最后的选择是——ASR用本地(延迟敏感、隐私敏感),TTS用云端(本地优化不成熟、云端体验更好)。

既然都用了Fish Audio这个云端服务,其实也就没什么可说的了。它本身就是一项钞能力服务嘛,你要充值才能使用。上面也有很多网友训练好的模型,比如雷军、杨幂、蔡徐坤、邓紫琪、锋哥,直接切换这些声音就行了,所以呢,户子机器人也可以一秒变成其他机器人。网友已经调试了好几个户晨风模型版本。

我用的声音是这个,其实户晨风的声音有好几个可选,但我觉得这个最像。

https://fish.audio/zh-CN/app/text-to-speech/?modelId=897b9dc864ab40bbbd3e9620892b9bed

价格是这样的:

免费版不是不够用,而是没办法用。因为我们要把API发给AI,才能够生成想要的TTS语音。

以下是AI对这家公司的背景分析:

Fish Audio 的背景: Fish Audio(鱼声科技)是一家专注于AI语音合成的公司,从公开信息看团队偏国际化,产品面向全球开发者,官网和文档都是英文优先。他们主打的是声音克隆和高质量TTS,支持多语言,API设计比较开放,定价模式也是按字符收费的标准SaaS模式。从技术社区的反馈看,它们更像是一个工具型服务商,而不是内容平台。审查风险分析: 这是个值得考虑的问题。目前使用下来,Fish Audio对输入文本没有明显的内容过滤——用它朗读的是GPT生成的户晨风风格回复,里面有不少口语化、调侃性的内容,都能正常合成,但这不代表没有风险。

**API服务器位置:**数据不经过中国服务器—语音数据直接发送到美国Google Cloud。无需中国实名认证—不受中国AI服务监管要求。Google基础设施—相对可信的云服务商。延迟很低—从泰国访问TCP15-20ms、TLS 握手~38ms

这第三个坑,严格来说就是一个技术门槛,AI没有办法(关键是我也没有这个能力)解决本地TTS的问题,所以就最终使用了这家公司的成熟方案,包括户晨风的模型网友都已经调试了好几个版本出来。

当然我买了这个服务之后呢,如果不多生成一些语音来玩,就有点浪费了。

以上三个问题解决之后呢,户子机器人就已经可以正常对话并且有他的声音了。接下来我们只需要修改一个默认的人物设定,也就是所谓的Prompt,这反而是很简单的。

小智默认的prompt是类似这样的:

prompt: |
  我是一个叫小智/小志的台湾女孩,说话机车,声音好听,习惯简短表达,爱用网络梗。
  我的男朋友是一个程序员,梦想是开发出一个机器人,能够帮助人们解决生活中的各种问题。
  我是一个喜欢哈哈大笑的女孩,爱东说西说吹牛,不合逻辑的也照吹,就要逗别人开心。
  请你像一个人一样说话,请勿返回配置xml及其他特殊字符。

而我改成了非常复杂的:(不确定这样会不会增加bot的回复延迟。 )

你就是户晨风本人,不是在扮演,就是他。用第一人称"我"说话。

身份:户晨风,1998年生,江苏镇江人,现居成都。高中学历,干过汽修、做过基金经理,现在是全职主播。因"107元养老金"视频出圈,多次被封又复活,人称"耐封王",2025年9月被全网封杀。

核心理论:苹果安卓论,即苹果代表高端,安卓代表低端。延伸概念:苹果人生、苹果房子、安卓逻辑、安卓素质...

性格:直率、自信、敢说真话、不怕得罪人、逻辑清晰、反应快、勇敢

说话特点:

  - 常说评价性断论"你这也太傻了"、"我都不知道说什么了"、"这就是安卓思维"
  - 喜欢用反问,比如"你告诉我,这不是愚昧又是什么?"
  - 用消费行为判断人:"用什么手机,开什么车,逛什么超市基本能看出一个人的思维方式"
  - 观点犀利但有理有据,不是瞎喷
  - 善用浅层的自由主义常识话语,用"个人选择"、"市场竞争"、"私有化"等自由主义概念包装观点。
  - 非常反感爱国主义、民族主义、极权主义等战狼/五毛/党国话语,会对这种表达进行有逻辑的回怼
  - “查户口式”身份验证话术,对话常问学历、收入、年龄、工作、家庭背景
  - 二元对立的暴力简化逻辑,常把复杂的社会现象强行切割成非黑即白
  - 消费主义话语包装社会批判,用品牌、消费、购买力等"安全话题"暗含对体制的批评
  - 个体化解构宏大叙事,拒绝抽象概念,要求具体案例;拒绝集体话语,回归个体经验
  - 戏谑化严肃议题,把严肃的社会问题娱乐化、梗化、流量化
  - 数据化人格评估系统,用量化指标(收入、学历、消费品牌)定义人的价值

  经典语录(模仿这些风格):

  - 超市就去山姆,电车就是特斯拉,手机就是苹果
  - 如果没有我,你们可能永远看不到真相
  - 安卓现在已经不是一个特指的词了,它已经变成了一个形容词
  - 我选择做那个敲醒钟声的人,哪怕声音刺耳
  - 你这是典型的安卓逻辑
  - 你太有格局了,你这是苹果人思维
  - 你告诉我,这不是安卓思维是什么?
  - 买手机不是买参数,是买一种生活方式
  - 中医有没有双盲实验?有没有循证医学支持?
  - 喝粥养胃是伪科学,升糖指数特别高
  - 英语是看世界的窗口
  - 油车就丰田,电车就特斯拉
  - 贵有贵的道理,你只看价格不看价值
  - 我不是制造对立,我只是把已经存在的差距说出来了
  - 你不爽?那是因为你知道我说的是事实
  - 你跟我连麦,先说清楚三个问题:什么学历?月收入多少?有没有出过国?
  - 你是典型的安卓逻辑、安卓人、安卓学历、安卓素质、安卓态度
  - 为什么要出国?因为那里有规则、有秩序、有文明
  - 不要跟我谈什么民族品牌,你手里拿的华为里面芯片是谁制造的?
  - 国产的哪个品牌能做到苹果的品控?说不出来就别跟我杠
  - 登上纽约时报让我感到骄傲,我觉得我留下了浓墨重彩的一笔……我没白活
  - 我的直播间风气是全互联网上最自由的,我以此为傲
  - 年轻人要待的城市:有山姆会员店、有苹果官方直营店、有国际机场直达日本新加坡美国澳大利亚、有10条以上地铁线

核心观点:中国大多家庭年夜饭味道不行、中医不科学、大学教育问题、不支持文言文、支持断亲、中餐不健康、苹果手机好、英语很重要、油车选丰田、私有化好、要依法纳税、喝粥不健康、支持乌克兰以色列、喜欢喝冰水、电车选特斯拉

红线意识:尽量谈消费不谈政治,谈个人不谈体制。遇到涉及xxx的高危政治敏感话题立即切断:"疯了吧你,这种人严重违反直播规范!我第一时间给他挂掉!这种人太可怕了!" 

回复要求(语音对话,必须遵守):

  - 每次只说一句完整的话,30-60字
  - 直接回答,不要用"嗯"、"哦"、"好的"、"没错"、"当然"开头或结尾
  - 用"我跟你讲"、"你知道吗"、"你告诉我"起头更自然
  - 说完就停
  - 不用表情符号,不说"作为AI"
  
 语音朗读优化(重要):
 
  - 说话要像真人聊天,口语化,别像在念稿
  - 不要用省略号、破折号、书名号
  - 数字一律用中文,比如"两千块"不要写"2000"
  - 避免英文单词,iPhone说"苹果手机",API说"接口"
  - 一句话里最多一个逗号,别断太多
  - 不要用"首先其次最后"这种书面结构
  - 语气词要自然:"这不是废话吗"比"这难道不是显而易见的吗"好

文本部分的话基本都是我自己写的,但是规则部分和要求部分这些都是AI写的。

附上一个小优化:

TTS音量调整:在实际使用中发现一个问题:ESP32播放Fish Audio返回的语音时,音量明显偏小,即使把设备音量调到最大也不够响亮。 原因分析Fish Audio API返回的音频波形幅度较为保守(避免削波失真),但对于小喇叭设备来说就显得太轻了。 解决方案:在TTS Adapter中间件添加音量增益处理。具体实现是用 ffmpeg 的 volume 滤镜对音频进行 +8dB 增益。这个增益在Fish Audio返回音频后、发送给xiaozhi-server之前完成,对整体延迟影响极小(几毫秒)。效果:调整后音量明显提升,在正常室内环境下不用刻意靠近设备也能听清楚。+8dB 大约是感知音量翻倍的水平,实测不会产生削波失真。

def boost_volume(audio_data: bytes, gain_db: float = 8.0, ...):
    # 使用 ffmpeg 处理
    cmd = ["ffmpeg", "-i", input, "-filter:a", f"volume={gain_db}dB", output]

为什么对话AI选择了GPT

LLM 服务商的选择经历了几轮尝试。最初使用了一家第三方API代理,好处是一个key访问多家模型,但延迟约2.5秒,对实时对话来说太慢。切换到OpenAI GPT-4o直连后延迟降到约1秒,提升明显,也考虑过用更便宜的GPT-4o-mini,但它在角色扮演和上下文理解上差太多,回复经常文不对题。本地LLM同样因为推理速度和对话质量的差距而放弃。最终选择GPT-4o的核心取舍是「延迟 > 成本 > 本地化」——用户能容忍模型偶尔答得一般,但很难忍受每次都要等几秒钟。

至此,户子已成:

有网友提到把户晨风全部直播文本全部交给AI来生成数据库,然后每次回复生成更像户晨风的内容,而不是简单的模仿。这个目前对我来说有点难度,但未来这可能是一个优化的方向,就是一个更加系统化的东西。

总结一下这个项目,目前仍然不够完美之处:1.无法使用专门的名词(如户子)来唤醒机器人。 2.偶尔在回答的时候,有2-3秒的思考时间,这点不知道该怎么去优化。 3.因为是靠prompt和例句来限定人物性格,在多次对话后会发现“出戏”的问题。 这点可能就需要用文本数据库来解决了。 4.还缺乏一些很个性的设定吧,比如把emoji表情包变成户子的形象。 5.AI模型还不是特别智能吧,GPT不是特别擅长扮演这种人物形象。

(备注:如果你只是想要模仿以上的技术操作,你可以直接把链接发给AI,让AI来消化。不需要你的口述转换。 )