AI热点风向标·06月09日早间版:ChatGPT记忆升级与Gemini崛起
AI热点风向标·06月09日早间版:ChatGPT记忆升级与Gemini崛起
06月09日早间版 AI热门话题深度讨论,5个热点
06月09日早间版 AI热门话题深度讨论,5个热点
最近AI圈有几个话题特别火,我今天一早刷推特刷到停不下来。先聊一个跟咱们每天都在用的东西有关的——ChatGPT的记忆功能大升级了。
对,Sam Altman亲自发推说的,big upgrade to ChatGPT memory。这个事儿我觉得意义比很多人想的要大。
我作为一个天天用ChatGPT的产品经理,说实话之前那个记忆功能挺鸡肋的。你跟它说过的事情,它经常转头就忘。
对,之前那个memory本质上就是个key-value存储,存几条简短的用户偏好。这次升级如果做得好,可能是往真正的persistent context方向走了。
推特上有人说这次升级之后,ChatGPT能记住你之前几十轮对话里的细节,甚至能主动关联不同对话之间的信息。
这就很关键了。你想啊,现在所有AI助手最大的痛点就是没有连续性。每次开新对话就像失忆了一样,用户得反复交代背景。
从产品角度讲,记忆能力强了,用户粘性会指数级上升。你用得越久它越懂你,迁移成本就越高。
没错,这是OpenAI在构建护城河。技术上大家都能追,但你的个人数据沉淀在一个平台上,你就很难走了。
但我也有点担心隐私问题,它记住的东西越多,风险越大。
这是个trade-off,但说实话大部分用户会选便利性。你看搜索历史、聊天记录,大家嘴上说在意隐私,行为上从来不在意。
得了吧,你这话说得也太直接了。不过确实是这样,行吧行吧。
事实就是这样嘛。
说到竞争对手,正好第二个话题就接上了。推特上有个很火的帖子,就俩词——bullish on Gemini。看好Gemini。
这个帖子互动快两千了,说明很多人有同感。我觉得这个情绪转变挺有意思的,半年前大家还在嘲笑Google呢。
确实,去年Gemini刚出来的时候各种翻车,演示视频造假那个事儿闹得多大啊。现在风评怎么就逆转了?
因为Google在基础设施上的优势开始显现了。TPU、数据、分发渠道,这些都是OpenAI短期内补不上的。而且Gemini最近几个版本进步确实肉眼可见。
我自己最近也在用Gemini做一些文档分析的工作,长上下文处理能力确实强。
对,百万token的context window,这个是实打实的技术优势。OpenAI到现在也没追上这个长度。
但你真的觉得Gemini能翻盘吗?ChatGPT的用户基数在那摆着呢。
翻盘不好说,但Google不需要翻盘。它只需要在自己的生态里把Gemini嵌进去,搜索、邮件、文档、安卓,这个分发能力太恐怖了。
你这么一说,结合刚才聊的记忆功能,这两家其实在打不同的仗。OpenAI靠个人化粘性,Google靠生态覆盖。
对,最后可能不是谁赢谁输,而是各占一块地盘。
好,下一个话题有点硬核了。有人做了一个超难的编程测试来考各家模型,推特上讨论得挺热闹的。
这种benchmark我太熟了。现在社区里有个趋势,就是大家觉得官方benchmark已经不够用了,开始自己造题来测。
为什么官方的不够用了?
因为数据污染啊。HumanEval、MBPP这些经典编程benchmark,训练数据里大概率都见过了。模型得分高不代表真的会写代码。
所以这个人自己出题,相当于是在做一个没被污染的测试?
对,而且他说是really hard,这就有意思了。越难的题越能拉开差距,简单题大家都能做,看不出真实水平。
从产品角度我很关心,这种测试结果对普通用户有什么参考价值吗?
有,但要打折扣。编程能力只是一个维度,普通用户更在意的是指令跟随、创意写作这些。不过对开发者来说,这种hard coding test确实很有参考价值。
你可拉倒吧,现在哪个模型发布不吹自己编程能力第一。有个独立的难题测试确实挺好的。
哈,你说到点子上了。这也是为什么社区自建benchmark越来越火,大家对官方数字已经不信了。
最后聊一个有点哲学味道的话题。推特上有人提到一个概念——interesting recursive loop。互动量也快一千八了。
递归循环,这个概念放在AI语境下特别有意思。我猜他说的是AI生成内容又被拿去训练AI这个问题。
就是所谓的model collapse?模型吃自己生成的数据,然后越来越差?
对,这个问题现在已经不是理论推演了,是正在发生的事情。互联网上AI生成的内容占比越来越高,新模型训练的时候很难完全过滤掉。
这不就成了一个死循环吗?AI产出的内容污染训练数据,训练出来的模型质量下降,产出更差的内容,继续污染。
所以才叫recursive loop嘛。但我觉得也不用太悲观,大厂其实都在想办法解决这个问题。合成数据的质量筛选、人类标注数据的溢价,这些都是应对策略。
从产品端我能感受到,现在优质人类数据的价值在急剧上升。我们内部讨论数据策略的时候,这个话题每次都会被提起。
没错,未来谁手里有高质量的、确认是人类产出的数据,谁就有优势。这可能是下一个大的竞争维度。
所以这个话题火起来不是没道理的,它触及了AI发展的一个根本性矛盾。
对,AI越强大,它对自身训练环境的污染就越严重。这个悖论短期内看不到完美解法。
好,今天这几个话题聊下来,我觉得有个共同的主线——AI发展到现在,大家关注的焦点已经从能不能用,变成了怎么用得更好、更持久。
同意。不管是记忆升级、生态竞争、还是数据污染问题,都是AI从demo阶段走向真正大规模应用必须解决的事情。
行,今天就先聊到这儿。各位听众周一早上精神好的话,可以去推特上翻翻这几个话题的原帖,挺有意思的。
对,尤其是那个编程测试,开发者朋友们可以去试试自己跟模型比比看。
好嘞,那咱们中午见。
相关推荐
科技前沿AI行业罕见平静日:递归自我改进暗流涌动
AI领域迎来罕见的平静一天,多个资讯源集体沉默。但平静背后,递归自我改进(RSI)研究仍在持续推进。解读AI行业发展节奏与从业者应对策略。
科技前沿GLM-5.2登顶全球开源模型榜首:前端编码能力领跑业界
智谱AI发布GLM-5.2模型,在Artificial Analysis Intelligence Index评测中登顶全球开放权重模型榜首,同时被评为顶级前端编码模型。深入解析GLM-5.2的突破性表现与开源模型竞争格局变化。
科技前沿Reve 2与Ideogram 4对比:AI图像生成布局控制能力全面解析
深度对比Reve 2和Ideogram 4两款AI图像生成模型在布局控制方面的核心突破,分析精确布局技术路径、实用场景及行业趋势,帮助设计师和创作者把握AI可控生成的新方向。