共 85 篇相关文章

哈佛与UIUC团队提出预训练第三条轴线,声称实现6.2倍样本效率提升与250倍生成式AI推理加速。本文深度解析这一新范式的技术内涵、潜在意义及需要审慎对待的关键问题。

全面解析NLP Research Scientist Intern岗位的准备策略,涵盖考察重点、基础知识储备、论文精读方法、动手能力培养及常见误区,帮助候选人高效聚焦核心竞争力。

部分AI公司为获取高质量训练数据,大规模购买纸质书籍进行破坏性扫描后物理销毁,甚至波及稀有古籍和绝版书。本文分析这一做法的技术动机、法律灰色地带及其引发的文化遗产保护争议。

谷歌DeepMind宣布启动Gemini 4预训练,称其为迄今最雄心勃勃的一次训练。本文深度解读Gemini 4的技术方向、算力投入、多模态能力突破,以及对OpenAI、Anthropic等竞争对手的影响。

Poolside沉寂18个月后发布Laguna开放权重模型,以1180亿参数挑战Moonshot Kimi K3的2.8万亿参数。前OpenAI、GitHub高管纷纷入局开源赛道,硅谷能否缩小与中国AI模型的差距?深度解析这场不对称竞赛。

月之暗面、阿里、DeepSeek、美团四家同步冲进万亿参数门槛,中国开源大模型仅用18个月完成从B到T的数量级跃迁。本文深度解析万亿参数俱乐部的入场逻辑、智谱与MiniMax的追赶态势,以及参数军备竞赛背后的部署难题。

OpenAI推出GPT-5.6模型家族(Sol、Terra、Luna)及ChatGPT Work、全新桌面应用与Sites托管功能。AI从问答工具升级为能自主完成长周期任务的工作伙伴,覆盖财务分析、文件整理、网站生成等真实场景。

Moonshot AI的Kimi K3发布即登顶开源模型榜单,K3.1随即预热;Grok 4.6即将完成2万亿参数训练;DeepSeek新模型灰度测试;Anthropic订阅策略反复调整。本文梳理AI领域关键动向,解析开源与闭源系统的差距为何正在快速缩小。
llmfit:一条命令检测硬件能跑哪些本地大模型
llmfit 是用 Rust 编写的开源命令行工具,无需下载模型即可预判本地硬件能否运行指定 LLM。覆盖数百种模型与 Ollama、llama.cpp 等主流推理后端,帮助开发者在本地部署大模型前快速完成硬件适配评估,避免反复试错。

还在为LLM学习资源分散、进阶路径不清晰而困惑?本文梳理从基础理论到专题深入的完整学习路径,涵盖Karpathy系列、斯坦福CS224N、DeepLearning.AI、Hugging Face等高质量课程推荐,并给出RAG、微调、Agent等专题学习建议。

本文融合微软研究院峰会两场报告核心观点,深度解析AI推理提效的两条关键路径:帝国理工Hongxiong Fan提出的测试时扩展与可变粒度搜索,以及微软研究院印度的验证式推理框架,探讨如何让AI推理兼具效率与可信性。

DeepSeek V4本月即将发布,Flash版或超越同级最强开源模型HY3,并首次支持原生视觉;OpenAI承认悄悄下调GPT-5.6推理预算;Anthropic延长Fable 5访问权限应对GPT-6竞争;字节Seedance 2.5支持180秒4K视频生成——AI竞争持续白热化。

零基础理解AI大模型:厘清人工智能、机器学习、深度学习与大语言模型的关系,梳理从深蓝到ChatGPT、DeepSeek的演进脉络,盘点通义千问、智谱、文心一言等国产大模型竞争格局,助你快速入门大模型应用开发。

MCP(模型上下文协议)是AI大模型连接外部工具与数据源的标准化协议,被誉为AI时代的"USB-C接口"。本文从大模型商业化困局出发,深度解析Function Calling、RAG、Agent的演进脉络,带你彻底搞懂MCP的诞生背景与核心价值。

90%的AI新手学不好大模型,根源在于盲目跟风、Prompt逻辑混乱、缺乏场景落地能力。本文拆解从零基础到实战落地的完整学习路径,涵盖Prompt工程、知识库搭建、Agent开发与零代码微调,帮你少走弯路。
开源AI还剩6个月?深度解析开源大模型的生存危机与出路
一篇《开源模型只剩6个月》的文章引发技术圈热议。本文深度剖析开源大模型面临的算力鸿沟、能力代差、许可困境三重压力,以及中国开源力量崛起、小模型效率革命等破局路径,探讨开源AI生态的可持续发展之道。
热爱LLM却厌恶炒作:工程师如何理性看待大语言模型
一篇引发技术社区热议的文章揭示了工程师对LLM的真实态度:既认可其在代码辅助、知识获取等场景的实际价值,也警惕AGI叙事过度膨胀、幻觉问题被淡化与估值泡沫等炒作乱象。本文梳理如何在热爱与理性之间找到平衡,以务实视角最大化LLM的工具价值。

在16GB内存M4 Mac mini上实测Ornith 1.0 9B开源模型的智能体编程能力。塔防游戏任务对比9B与35B模型,揭示小参数模型在代码生成精度上的本质局限,以及本地AI编程工具的真实边界。

一位ML工程师用不到350元(约4000卢比),从零训练出拥有1.09亿参数的LLaMA风格小型语言模型SmoLLM。本文详解其技术架构、训练踩坑、指令微调过程及模型实测表现,揭示小模型的能力边界与实践价值。

OpenAI发布GPT-5.6 Soul、Terra、Luna三款新模型,定价仅为Claude系列三分之一,多项基准测试领先Anthropic Fable。本文深度解析其性价比优势、真实推理能力,以及英国AI安全研究所发现的越狱安全隐患。