游乐游手机版
首页/AI热点日报/热点详情

上半年工作中使用的AI产品与技术盘点

类型:热点整理2026-07-19
从移动开发转向AI应用开发,这条路走了半年多,现在回头看看,踩过的坑和收获都不少。这篇文章不讲空话,直接把上半年在实际产品里用到的AI技术和选型思路拆开来说——端侧语音模型怎么落地、开源LLM怎么筛、多模态那套东西怎么搭起来。希望对正在摸索方向的人有点参考价值。 最近两三个月,算是彻底和移动开发者这

从移动开发转向AI应用开发,这条路走了半年多,现在回头看看,踩过的坑和收获都不少。这篇文章不讲空话,直接把上半年在实际产品里用到的AI技术和选型思路拆开来说——端侧语音模型怎么落地、开源LLM怎么筛、多模态那套东西怎么搭起来。希望对正在摸索方向的人有点参考价值。

盘点一下上半年工作用到的AI产品和技术

最近两三个月,算是彻底和移动开发者这个标签说再见了,一头扎进了偏模型应用开发的方向。跟着项目走了一遍,虽然刚开始是照葫芦画瓢,但收获确实不少。这周项目节奏缓下来,正好回顾一下这半年在产品开发中接触到的各种AI产品和技术。

今年在产品上最先落地的AI技术,是4月份上线的离线端语音模型。之前写过一篇文章专门介绍过,社区反馈还不错。技术栈用的是Sherpa(语音处理框架)+ KokoroTTS(模型)。之前一直用AWS的TTS服务,技术调用链路长且复杂,端侧语音调用就简单得多——所有处理都发生在设备本地。不过性能是个问题,需要把长语句拆成短片段来生成,不然单次生成太多文本,耗时明显变长。

到了5月份,开始调研新项目。移动端开发任务没了,两个客户端工程师直接转向前端和模型方向。团队分工明确:我负责找模型和搭建测试环境。能找开源模型的地方其实很有限——就像找代码库首选GitHub,开源模型的首选地是Huggingface,有些模型还在上面搭了Space让用户直接上手试。我们选的是参数量适中、专门针对聊天场景优化过的模型。观察下来发现,很多开源模型都是拿Mistral(被提到的频率非常高)和其他基座模型合并出来的,有的是“儿子模型”,甚至还有“孙子模型”,有的是经过重新训练调优的。Reddit社区上讨论很热闹,选模型时参考这些社区反馈非常管用。

运行部署模型的工具用的是Ollama。年初测试DeepSeek小模型的时候就接触过Ollama,当时只是在电脑上跑跑小模型。这次搭在AWS服务器上,用Ollama运行选好的模型,开放API给客户端调用。项目跑了快两个月,还算稳定,主产品线也开始用这个方案了。目前还没遇到大瓶颈。不过朋友推荐过vLLM,强调并发和吞吐能力,按理说后端就该用这个。现在的方案只是临时的,真要遇到瓶颈肯定要往那边迁——这是后话。测试语言模型用的是Gradio这个开源工具来搭网页。如果你用过Stable-Diffusion-WebUI,一定对Gradio不陌生——SDWebUI的界面就是用Gradio搭的,风格太明显了。

产品涉及多模态,不光文字,还有语音和图片。语音克隆这一块,本来想用CosyVoice 3.0,但当时那模型只给了效果展示,没最终开源。调研一圈后,最终选了一个商业语音克隆服务——Papla Media。上传一段语音,模型就能根据这段语音泛化出任意文本对应的语音。效果很稳。

再接下来就是最近一个月重点关注的生图模型选择。团队把Stable-Diffusion-WebUI和ComfyUI都试了一遍。最初生图服务用的SDWebUI,模型从C站上找的realDream_15SD15.safetensors。目标很明确:针对指定人物生图(保持人脸一致),同时人物姿势要多样化。光是保持人脸一致性问题,就试过提示词方案、IPAdapter方式,效果都不理想,最后只能选效果最好但成本也最高的LoRA方案。人物姿势方面,发现LoRA素材不够多元,姿势很难遵循提示词,于是又引入OpenPose做姿势控制。针对人脸细节优化,又加了AdDetailer插件。说实话,SDWebUI这套方案全靠各种插件续命……所有插件最后还得封装成API暴露给后端调用。但有一个问题始终没搞定——手部畸形。从C站单独下了手部LoRA模型也优化不了,问淘宝卖LoRA模型的卖家,对方说SD1.5甚至SDXL基座的模型都有这毛病,最后推荐用FLUX模型。于是老板让接着搞ComfyUI+FLUX的组合。工作流搭起来倒不复杂,但人脸一致性还得继续找淘宝店卖家定制LoRA模型。为了省钱,老板让我自己研究LoRA训练。最近一两周基本全泡在FLUX+LoRA的技术上,学习方式就是网上看视频、问ChatGPT、自己动手。ComfyUI上现成的LoRA工作流不少,麻烦的是各种参数配置。训练用的机器是A10G显卡,刚开始用感觉很快,但跑LoRA训练才发现这显卡还是慢……2000步的LoRA训练,一次差不多两个半小时,这还算参数不大的情况。如果把训练图片尺寸再搞大点,时间就更长了。

这半年在产品里实际用到的AI技术大概就这些。还没算自己私下用的一些AI产品,比如各种AI编码工具。LoRA训练踩的坑也不少,篇幅太长,就不展开了。

来源:https://www.53ai.com/news/OpenSourceLLM/2025073075326.html

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。