<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
	<channel>
		<title>LLM on 苏然的博客</title>
		<link>https://bml.asia/tags/llm/</link>
		<description>Recent content in LLM on 苏然的博客</description>
		<generator>Hugo</generator>
		<language>zh-CN</language>
		
		
		
		
			<lastBuildDate>Thu, 17 Sep 2026 04:19:55 +0800</lastBuildDate>
		
			<atom:link href="https://bml.asia/tags/llm/index.xml" rel="self" type="application/rss+xml" />
			<item>
				<title>大模型效果不好怎么办：是数据的锅还是模型的锅</title>
				<link>https://bml.asia/posts/model-vs-data/</link>
				<pubDate>Fri, 11 Sep 2026 04:30:41 +0800</pubDate>
				<guid>https://bml.asia/posts/model-vs-data/</guid>
				<description>&lt;p&gt;&lt;span style=&#34;text-indent:2em;display:block;&#34;&gt;平时聊天里最常听到的一种吐槽，是说大模型笨，问什么答非所问，换了个更大的模型也还是那个样子。这话有它普遍的道理，只是把原因全归到模型头上，多少有点冤枉。模型本质上是在学习数据里的模式，如果一类任务几乎没进过训练数据，不管是小众的专业知识、非常冷门的格式，还是公司内部那套外人看不懂的业务逻辑，它就是没见过，没见过的东西它只能靠编，输出自然胡说八道，也就是常说的“大模型幻觉”。这种时候只要喂上高质量示例，无论是预训练阶段直接灌进去、用 RAG（检索增强生成）现查现用，还是做少量微调（SFT），能力立刻肉眼可见地涨上来。很多企业直接拿开源小模型配上私有知识库，效果就已经够用，正因为这类场景的瓶颈确实在数据，不在基座本身。于是很容易得出一个直觉：只要数据够多够好，模型本身强不强无所谓。&lt;/span&gt;&lt;/p&gt;</description>
			</item>
			<item>
				<title>很多问题不必联网搜索：大模型的基准能力已经够用</title>
				<link>https://bml.asia/posts/trust-the-model/</link>
				<pubDate>Mon, 07 Sep 2026 03:48:32 +0800</pubDate>
				<guid>https://bml.asia/posts/trust-the-model/</guid>
				<description>&lt;p&gt;&lt;span style=&#34;text-indent:2em;display:block;&#34;&gt;以前用 AI 有个改不掉的习惯：不管问什么，都先把联网搜索打开，好像不搜一下心里就没底。查个资料要搜，写段代码要搜，甚至连一个成语是什么意思，都想让它先去网上转一圈再回答。搜索框像是我的安全带，系上了才敢往前开。直到最近整理一批问题的时候，我试着把联网关掉，直接让模型用自己的本事作答，结果出乎意料——很多回答不但没有变差，反而更快、更干净，也更像是一个完整的思路，而不是几段网页摘要拼起来的拼盘。&lt;/span&gt;&lt;/p&gt;</description>
			</item>
			<item>
				<title>Meta 发布新模型 Muse Spark 1.3：token 用量直降 25%</title>
				<link>https://bml.asia/posts/meta-muse-spark-1-3/</link>
				<pubDate>Thu, 03 Sep 2026 11:57:47 +0800</pubDate>
				<guid>https://bml.asia/posts/meta-muse-spark-1-3/</guid>
				<description>&lt;p&gt;　　Meta 又发新模型了，这次叫 Muse Spark 1.3，官方给的说法是“迄今在模型性能上最大的一次跃升”，带队的是首席 AI 官 Alexandr Wang——就是扎克伯格从前一家公司挖来的那位。说实话，这两年各家发模型的通稿看得人有些麻木，什么“史诗级跃升”翻译过来基本等于“性能提升了一些”，但这条新闻里有一组数字让我多看了两眼：完成同样的任务，1.3 需要消耗的 token 比 1.2 少了四分之一。&lt;/p&gt;</description>
			</item>
			<item>
				<title>MoE 架构，天生适配显存不足的机器</title>
				<link>https://bml.asia/posts/t4-35b-moe-offload/</link>
				<pubDate>Wed, 02 Sep 2026 16:44:45 +0800</pubDate>
				<guid>https://bml.asia/posts/t4-35b-moe-offload/</guid>
				<description>&lt;p&gt;　　大模型对显存的需求，过去几年几乎是一条死规矩：多少参数的模型，就得配多大显存的卡，装不下就是装不下。但混合专家架构正在改写这条规矩，而且它改写的方式，恰好是显存不足的机器最需要的。这类模型的参数大头是几百位“专家”，每次回答只唤醒其中一小撮，其余绝大多数时间在休息；真正每次都要干活的注意力部分，参数量反而很小。这个结构天然就适合拆开摆放：休息的专家丢进大内存待命，干活的密集部分留在显存里全力跑，CPU 和 GPU 各干各擅长的事，谁也不委屈。稠密模型做不到这一点——它的每个参数每次都要参与计算，拆一半到 CPU 上，速度立刻崩掉。所以 MoE 不是“勉强能跑在低配机器上”，而是天生就该这么跑。&lt;/p&gt;</description>
			</item>
			<item>
				<title>玩腻了 Agent：所谓调教，不过是提示词对抗的循环</title>
				<link>https://bml.asia/posts/hermes-agent-prompt-adversarial-loop/</link>
				<pubDate>Mon, 24 Aug 2026 13:12:37 +0800</pubDate>
				<guid>https://bml.asia/posts/hermes-agent-prompt-adversarial-loop/</guid>
				<description>&lt;p&gt;　　把市面上的 Agent 软件挨个试过一遍，你会觉得它们“简单”得出奇一致。不管什么产品，总能找到一处设定系统提示词、约束框架的地方，剩下的事就是按自己的需求去改这些设定——加几条规则、调调人格、补点记忆约束，看起来就把 Agent 驯服了。&lt;/p&gt;</description>
			</item>
	</channel>
</rss>
