<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
	<channel>
		<title>RAG on 苏然的博客</title>
		<link>https://bml.asia/tags/rag/</link>
		<description>Recent content in RAG on 苏然的博客</description>
		<generator>Hugo</generator>
		<language>zh-CN</language>
		
		
		
		
			<lastBuildDate>Thu, 17 Sep 2026 04:19:55 +0800</lastBuildDate>
		
			<atom:link href="https://bml.asia/tags/rag/index.xml" rel="self" type="application/rss+xml" />
			<item>
				<title>大模型效果不好怎么办：是数据的锅还是模型的锅</title>
				<link>https://bml.asia/posts/model-vs-data/</link>
				<pubDate>Fri, 11 Sep 2026 04:30:41 +0800</pubDate>
				<guid>https://bml.asia/posts/model-vs-data/</guid>
				<description>&lt;p&gt;&lt;span style=&#34;text-indent:2em;display:block;&#34;&gt;平时聊天里最常听到的一种吐槽，是说大模型笨，问什么答非所问，换了个更大的模型也还是那个样子。这话有它普遍的道理，只是把原因全归到模型头上，多少有点冤枉。模型本质上是在学习数据里的模式，如果一类任务几乎没进过训练数据，不管是小众的专业知识、非常冷门的格式，还是公司内部那套外人看不懂的业务逻辑，它就是没见过，没见过的东西它只能靠编，输出自然胡说八道，也就是常说的“大模型幻觉”。这种时候只要喂上高质量示例，无论是预训练阶段直接灌进去、用 RAG（检索增强生成）现查现用，还是做少量微调（SFT），能力立刻肉眼可见地涨上来。很多企业直接拿开源小模型配上私有知识库，效果就已经够用，正因为这类场景的瓶颈确实在数据，不在基座本身。于是很容易得出一个直觉：只要数据够多够好，模型本身强不强无所谓。&lt;/span&gt;&lt;/p&gt;</description>
			</item>
	</channel>
</rss>
