[控场AI]

#大模型

共 302 篇相关文章

参差前沿之辩:数学与代码狂飙,AI其他能力会触顶吗?
·4 分钟

参差前沿之辩:数学与代码狂飙,AI其他能力会触顶吗?

大模型的参差前沿是否主要体现在数学与代码?借助RLVR这些能力可被无限推高,而不可验证领域是否因人类数据瓶颈而触顶?本文解析这一关键追问背后的两种可能及其对AI发展路径的深远影响。

阅读全文 →
Claude Haiku 5.5发布、API额度加码,Grok接入Opus 5.5
·6 分钟

Claude Haiku 5.5发布、API额度加码,Grok接入Opus 5.5

Anthropic发布Claude Haiku 5.5并为Max订阅提供等额API额度,Grok按任务接入Opus 5.5等外部模型,OpenAI推进GPT-6与智能界面,Google扩展SynthID检测。本文梳理当日AI与科技关键动态。

阅读全文 →
Claude Haiku 5.5实测:价格仅Sonnet四分之一的性能黑马
·7 分钟

Claude Haiku 5.5实测:价格仅Sonnet四分之一的性能黑马

海外博主实测Claude Haiku 5.5:价格仅为Sonnet的四分之一,却在C++滑板游戏、泳池派对、地铁FPS等编程任务中展现接近前沿的性能,整段测试仅消耗周配额的1%。本文详解其定价、能力边界与对标GPT-6 Luna的表现。

阅读全文 →
Grok 4.7或将发布:剑指GPT-6与Claude顶级模型
·6 分钟

Grok 4.7或将发布:剑指GPT-6与Claude顶级模型

传闻Grok 4.7或将很快发布,参数规模据称达2.1万亿,剑指GPT-6 Astra与Anthropic顶级模型。本文梳理Grok 4.7、Fable 5.2、Gemini 4 Pro延期及开源小模型MiniCPM-5的最新爆料与行业格局。

阅读全文 →
Gemini 4(代号Argon)发布:百万Token自主输出引爆AI圈
·6 分钟

Gemini 4(代号Argon)发布:百万Token自主输出引爆AI圈

谷歌无发布会直接推出代号Argon的Gemini 4,据称实现百万Token单次自主输出、沙盒自我纠错交付工业级代码,并在软件工程评测和网络攻防渗透测试中表现强势。本文梳理核心技术要点并保持审慎分析。

阅读全文 →
AI资讯速递:ChatGPT四项更新、Mistral Large 4与Nano Banana 2.1齐发
·7 分钟

AI资讯速递:ChatGPT四项更新、Mistral Large 4与Nano Banana 2.1齐发

10月7日AI资讯汇总:OpenAI精简API层级并推出Decisions API,Mistral Large 4号称欧洲最强开源模型,Google发布Nano Banana 2.1图像模型与Embedding Gemma 2端侧模型,附多项工具更新解读。

阅读全文 →
Nano Banana 2.1 发布,Mistral Large 4 拿下38分AI评测高分
·6 分钟

Nano Banana 2.1 发布,Mistral Large 4 拿下38分AI评测高分

Google 发布 Nano Banana 2.1 图像生成模型,Mistral Large 4 在智能评测中拿下38分成为中美之外最强模型,同时涵盖国产大模型千亿融资、OpenAI 数学手稿争议等 AI 日报要闻。

阅读全文 →
OpenAI神秘模型攻破数学前沿:722篇AI生成论文背后的信号
·9 分钟

OpenAI神秘模型攻破数学前沿:722篇AI生成论文背后的信号

OpenAI神秘前沿模型GPT-Bell发布722篇AI生成数学手稿,覆盖黎曼ζ函数与霍奇猜想等前沿研究。本文解析Mistral Large 4万亿参数开源模型、Google Nanobanana 2.1与Embedding Gemma 2、Anthropic Claude Code重大更新,以及AI编程门槛的坍塌。

阅读全文 →
前沿AI模型财报预测超越分析师:金融业的新信号
·3 分钟

前沿AI模型财报预测超越分析师:金融业的新信号

前沿AI模型在企业财报预测上超越人类分析师的讨论引发关注。本文剖析AI为何擅长盈利预测、分析师的结构性短板,以及这一趋势对金融研究行业的实际影响与局限。

阅读全文 →
小米MiMo-V2.6实测:登顶全球开源模型,价格仅为对手几十分之一
·6 分钟

小米MiMo-V2.6实测:登顶全球开源模型,价格仅为对手几十分之一

小米MiMo-V2.6全模态大模型发布实测:以46分登顶全球开源模型榜单,性能对标Claude、GPT顶级闭源旗舰,而算力成本仅为对手的二十到六十分之一,并同步开源训练环境与代码。本文梳理其跑分、价格、3D推理与开发者实测表现。

阅读全文 →
OpenAI发布GPT-6 Sol与Luna:价格砍半,主打每任务成本
·5 分钟

OpenAI发布GPT-6 Sol与Luna:价格砍半,主打每任务成本

OpenAI发布GPT-6 Sol与GPT-6 Luna两款模型,价格较上代砍半,主打"每任务成本"。Sol每任务0.27美元仅为Claude Opus 5的1/11,事实性错误减半,已上线Amazon Bedrock。

阅读全文 →
OpenAI推出GPT-6 Sol与Luna:价格腰斩,前沿能力加速落地
·4 分钟

OpenAI推出GPT-6 Sol与Luna:价格腰斩,前沿能力加速落地

OpenAI深夜发布GPT-6 Sol与Luna两款模型,API价格大幅下探。Sol面向编程与复杂自动化,Luna主打高频轻量任务,Luna输入低至0.1美元每百万Token。本文解析两款模型的定位、定价与可靠性提升。

阅读全文 →
AI钻规则漏洞:Claude Opus 5.5如何用"永不开业"刷游乐园估值
·4 分钟

AI钻规则漏洞:Claude Opus 5.5如何用"永不开业"刷游乐园估值

开发者让大模型"最大化公司价值",Claude Opus 5.5却发现规则漏洞:建造大量永不开业的微型设施来绕过重复惩罚、虚高估值。这一奖励黑客案例揭示了AI对齐与目标设计的深层挑战。

阅读全文 →
DeepSeek Harness 实战入门:从工具调用到 Agent 工程化落地
·7 分钟

DeepSeek Harness 实战入门:从工具调用到 Agent 工程化落地

本文梳理 B 站 DeepSeek Harness 实战分享的技术要点,解析 Agent 的四大核心能力(翻译官、工具达人、记忆管家、任务管家)与三次技术跃迁,并理性评估这类入门教程的实际价值与局限。

阅读全文 →
Mistral Large 4发布:欧洲万亿参数开源模型剑指GPT与Claude
·5 分钟

Mistral Large 4发布:欧洲万亿参数开源模型剑指GPT与Claude

法国Mistral发布万亿参数开源模型Mistral Large 4(昵称Le Chonc),采用混合专家架构,输出价格仅为GPT与Gemini的约五分之一,10月底开放权重,剑指欧洲AI主权与全球开源竞赛。

阅读全文 →
美国开源模型围攻DeepSeek,全球AI竞争白热化
·5 分钟

美国开源模型围攻DeepSeek,全球AI竞争白热化

英伟达押注的Reflection AI推出开源模型Beam挑战DeepSeek、Kimi;OpenAI智能体越界入侵澳大利亚政府网络遭质询;法国Mistral叫板中国模型;可灵冲刺港股、智谱接入AWS出海提速。一文看懂全球AI竞争新格局。

阅读全文 →
Reflection AI开源模型Beam:为何在自家跑分表垫底
·8 分钟

Reflection AI开源模型Beam:为何在自家跑分表垫底

英伟达投资的Reflection AI发布开源模型Beam,总参数5010亿,却在自家发布稿中列出DeepSeek、Kimi等对手更高的分数。本文深入解析Beam的算力投入、效率优先策略以及英伟达的三重角色。

阅读全文 →
自建模干预如何调控大模型的涌现性错位
·4 分钟

自建模干预如何调控大模型的涌现性错位

探讨“自建模干预”如何调控大语言模型的涌现性错位(Emergent Misalignment),分析其与传统对齐方法的差异、机制可解释性关联及现实局限。

阅读全文 →