2026-7-24 AI可以做些什么
2016从野生程序员到全栈,到AI,新增了不少技能。
只说遇到的一些有些难的技能。
文本
文本OCR在当前已经不是问题,即便是公式、图表混合,借助现有的开源工具或API都可以达到90%以上的准确度。问题在于图片扭曲需要校核,或者黑白图转彩色。
图片
国外国内图片生成大都是免费的,毕竟单张图片消耗的算力可以忽略不计(视频)。最近一段时间GPT、Gimini文生图的质量大打折扣,反而不及Grok和Qwen。
图片识别的Vsion,目前deepseek还没有开放API,Qwen一时半会也不想接入它的API。
这就导致CAD图形的识别转换有点卡壳。
音频
主要是语音克隆,如果没有太高要求,微软的tts也可以用。机器音终究不是很好听。
至于音乐生成,这在gemini也是免费的,不过暂时也用不到。
视频
(1)纯舞蹈,Seedanc很好,也很贵,所以普通用户要没有强大的变现渠道,大概率会入不敷出。
(2)数字人,语音驱动口型始终没能很好的解决,ComfyUI又相关的流程,但是G卡没有,算力还是有些吃不消。
(3)纯文字,hyperframe、remotion挺好的,也能做到VVT对齐,知识密度也足够,但是当前社会在,传播知识本身就限制了流量。
(4)视频字幕处理,英文转中文,中文转英文,就牵扯到VVT对齐和语义损失,孙火旺的语音就不好克隆。
应用场景很多,信息查也足够大,但是如何变现就是个很大的问题。
评论
发表评论