2026-7-24 AI可以做些什么

 2016从野生程序员到全栈,到AI,新增了不少技能。

只说遇到的一些有些难的技能。


文本

文本OCR在当前已经不是问题,即便是公式、图表混合,借助现有的开源工具或API都可以达到90%以上的准确度。问题在于图片扭曲需要校核,或者黑白图转彩色。


图片

国外国内图片生成大都是免费的,毕竟单张图片消耗的算力可以忽略不计(视频)。最近一段时间GPT、Gimini文生图的质量大打折扣,反而不及Grok和Qwen。

图片识别的Vsion,目前deepseek还没有开放API,Qwen一时半会也不想接入它的API。

这就导致CAD图形的识别转换有点卡壳。


音频

主要是语音克隆,如果没有太高要求,微软的tts也可以用。机器音终究不是很好听。

至于音乐生成,这在gemini也是免费的,不过暂时也用不到。


视频

(1)纯舞蹈,Seedanc很好,也很贵,所以普通用户要没有强大的变现渠道,大概率会入不敷出。

(2)数字人,语音驱动口型始终没能很好的解决,ComfyUI又相关的流程,但是G卡没有,算力还是有些吃不消。

(3)纯文字,hyperframe、remotion挺好的,也能做到VVT对齐,知识密度也足够,但是当前社会在,传播知识本身就限制了流量。

(4)视频字幕处理,英文转中文,中文转英文,就牵扯到VVT对齐和语义损失,孙火旺的语音就不好克隆。


应用场景很多,信息查也足够大,但是如何变现就是个很大的问题。



评论

此博客中的热门博文

2026-4-17 币安短线操作纪律

2026-5-13 Spot Hunter盯盘设置