共 22 篇相关文章

一个极简动力学系统实验:不使用MLP、Transformer或注意力层,仅靠共现压力驱动的点吸引子动力学,在SimLex-999上实现语义相似度学习。本文详解其模型结构、训练方法、语义效果与局限性。

探索自托管小票记账工具的核心需求与技术实现,涵盖OCR小票识别、商品价格追踪、食品开支分类与预算管理,并推荐Firefly III等开源方案,帮助你在保护数据隐私的前提下精细化管理日常消费。

一文讲透AI大模型的本质原理:从概念层级、Transformer工作机制到概率特性,帮助测试工程师理解大模型的优势与劣势,掌握AI测试的实用思路与方法。

jlens-gguf是一款开源工具,将Anthropic雅可比透镜(Jacobian Lens)可解释性方法引入GGUF与llama.cpp生态,支持模型内部观测、实时引导(steering)及abliteration操作,兼容dense与MoE架构,让本地推理用户也能探索大模型内部机制。

大模型微调是什么?本文用通俗语言讲清微调的本质原理、适用场景与企业实战路径,帮助零基础开发者理解何时需要微调、微调改变了什么,掌握AI大模型应用开发的完整技能体系。

从词向量、词嵌入到RNN、BERT、Transformer,再到ChatGPT与GPT-4——本文系统梳理大语言模型的完整进化脉络,带你读懂AI 2.0时代的技术根基与Prompt范式的确立过程。

Anthropic Claude Code Artifacts正式面向Pro/Max用户开放,支持生成交互式网页并实时部署。本文盘点AI Agent最新动态:阿宝公测、字节EdgeBench评测、微软Frontier Company成立,及OpenAI、Anthropic的算力布局。

深度解析两项前沿稠密检索研究:Hobbit通过梯度分析自动构造难批次,突破传统难负样本挖掘瓶颈;Disco以次模协同覆盖替代单文档竞争,重构Top-K检索范式。涵盖对比学习、双编码器训练与多跳问答应用。

无需写提示词、无需对接MCP,LibTV「截图转宣传片」Skill让设计师贴图即可生成宣传视频。本文拆解从Figma设计稿到动态短片的一键工作流,解析AI Agent创意封装趋势。
潜在推理:超越思维链的下一代AI推理范式
思维链(CoT)真的等于AI在"思考"吗?本文深度解析潜在推理(Latent Reasoning)的崛起,涵盖Coconut、HRM、BDH等前沿方向,探讨可解释性与推理效率的本质权衡,以及高风险场景下的治理架构设计。

零基础理解AI大模型:厘清人工智能、机器学习、深度学习与大语言模型的关系,梳理从深蓝到ChatGPT、DeepSeek的演进脉络,盘点通义千问、智谱、文心一言等国产大模型竞争格局,助你快速入门大模型应用开发。

Anthropic发布Jacobian-Lens(雅可比透镜)后,开发者将其从可解释性工具反向用于行为编辑,通过手动调整J-Space定向修改大模型输出。本文深度解析其技术原理、表征工程价值与AI安全隐忧。

MosiAI开源MOSS-Transcribe-Diarize-0.9B,一体化实现语音转写与说话人分离,支持128K上下文单次处理90分钟音频,内置热词增强,SGLang Day-0支持,轻量可部署于边缘设备。

一道涉及K-means与随机森林的机器学习考题引发社区热议。本文深度解析监督学习与无监督学习的核心区别,揭示混合特征场景下的算法选型逻辑,帮助你真正掌握机器学习建模的第一步。

深度解析Ideogram 4核心优势:真实摄影质感、强文字生成能力、中文提示词支持。教你用全自动ComfyUI工作流+通义千问3,跳过复杂JSON结构化提示词,输入想法即刻出图,8GB体量轻松本地部署。

DeepSeek开源推理加速工具包DSpec实测报告:草稿模型+智能调度实现无损加速,GSM8K接受长度达6,复现官方数据。本文拆解工作原理、显存占用与接受率衰减规律,适合本地部署开发者参考。

Unsloth v0.1.461-beta 发布,修复 Studio 中本地 GGUF 视觉模型在 llama-server 上的加载问题,新增变体目录配套文件查找逻辑,提升本地多模态部署稳定性。适合使用 LLaVA、Qwen-VL 等视觉语言模型的开发者关注。

嵌入坍缩是小语言模型训练中的隐蔽瓶颈,导致词向量表示趋同、模型性能受损。本文深入解析分散损失(Dispersion Loss)的核心原理——通过在训练阶段引入表示分散约束,以零推理成本提升小模型的表达质量,为边缘AI与轻量化部署提供新思路。