共 3691 篇相关文章

深入解析大模型Agent技术框架,涵盖RAG检索增强生成、Agent核心组件(工具集、记忆机制、规划推理)以及Agent Tuning专项训练流程与成本考量,帮助开发者理解智能体从原理到落地的完整路径。

大模型本质上不是搜索引擎,而更像一个超级压缩机。本文从数据量、参数量、深度神经网络三大特征出发,解读大模型如何通过压缩语料掌握语意规律,以及智能涌现现象的原理与局限。

OpenRouter数据显示中国AI模型已占美国AI消费量58%。DoorDash、Airbnb等硅谷巨头纷纷采用Kimi、DeepSeek、通义千问等中国开源大模型,凭借低价高性能和开源权重优势快速渗透全球市场。

顶级AI大语言模型能写代码、通过专业考试,却连一张准确的图表都画不出来。本文深入剖析AI在图表生成上频频翻车的根本原因,揭示大模型智能不均衡的真相,并给出人机协作的实践建议。

一文讲透AI大模型的本质原理:从概念层级、Transformer工作机制到概率特性,帮助测试工程师理解大模型的优势与劣势,掌握AI测试的实用思路与方法。

阿里Qwen下一代、DeepSeek V4 GA、智谱GLM新版几乎同步逼近发布节点。本文梳理三大国产大模型最新进展、实测表现及蒸馏争议,带你抢先了解国产AI新旗舰的核心信息。

D-Flash通过快扩散并行草稿与目标特征KV注入,解决投机解码中自回归Drafter的延迟瓶颈。16个Token仅需6毫秒,HumanEval加速达3.5倍,全面超越EAGLE3和MTP方案。

深度解析AI智能体(Agent)如何颠覆传统软件测试模式:大模型与Agent的核心区别、四大能力维度(规划/记忆/工具/技能),以及测试工程师如何借助Agent实现用例生成效率十倍提升。
动手学大模型:4.4万星LLM实战教程完整指南
《动手学大模型 Dive into LLMs》是GitHub上44830星的中文LLM实战教程,以Jupyter Notebook形式覆盖Transformer原理、LoRA微调、RAG搭建、Prompt Engineering等核心主题,适合开发者系统入门大语言模型。

零基础小白如何上手Claude Code?本文详解VS Code安装配置、国内接入大模型的两种方式、四种核心使用模式,并手把手带你不写一行代码完成第一个实用小工具,真正让AI替你干活。

Kimi、阿里千问、DeepSeek凭借MoE架构、本土数据优势与开源飞轮效应,以极低成本逼近OpenAI、Anthropic等闭源巨头。本文深度拆解国产开源大模型的追赶逻辑与商业哲学差异。

近期流传的「免费零门槛白嫖全球AI大模型」视频暗藏多重陷阱:虚假版本号、数据泄露、钓鱼盗号……本文从技术角度逐一拆解其运作套路,并提供合规使用ChatGPT、Claude、DeepSeek等海外与国内AI模型的安全替代方案。

月之暗面发布2.8万亿参数开源大模型Kimi K3,性能直逼Anthropic与OpenAI旗舰产品,再掀"DeepSeek时刻"。本文深度解析Kimi K3的技术冲击、算力封锁悖论,以及开源策略如何重塑全球AI竞争格局。

企业级AI大模型岗位要求已全面升级,从流式输出中断恢复、高并发承载、多租户隔离,到大模型网关、Langfuse可观测追踪与LLM评估平台,掌握这八大核心能力,助你从"会用工具"进阶为"工程化落地专家"。

月之暗面、阿里、DeepSeek、美团四家同步冲进万亿参数门槛,中国开源大模型仅用18个月完成从B到T的数量级跃迁。本文深度解析万亿参数俱乐部的入场逻辑、智谱与MiniMax的追赶态势,以及参数军备竞赛背后的部署难题。

无ChatGPT账号也能用Codex!本文详解如何通过Codex++管理工具,将DeepSeek、豆包等国产大模型接入Codex,包含Base URL配置、API Key获取、Token充值全流程步骤。

本文通过真实Python副业接单案例,详解如何用DeepSeek等AI大模型提升网站逆向分析效率:从绕过反调试、定位加密参数、识别ob混淆,到让AI一键还原SM2/SM4国密代码。掌握"人工定位+AI还原"的高效接单方法论。

jlens-gguf是一款开源工具,将Anthropic雅可比透镜(Jacobian Lens)可解释性方法引入GGUF与llama.cpp生态,支持模型内部观测、实时引导(steering)及abliteration操作,兼容dense与MoE架构,让本地推理用户也能探索大模型内部机制。