Skip to main content

If you’re going to throw your time, energy, and youth at a company, try to join one that’s not just making a better mousetrap. Find a business that’s starting a revolution. A company that’s likely to make a substantial change in the status quo has the following characteristics:

  • It’s creating a product or service that’s wholly new or combines existing technology in a novel way that the competition can’t make or even understand.
  • This product solves a problem—a real pain point—that a lot of customers experience daily. There should be an existing large market.
  • The novel technology can deliver on the company vision—not just within the product but also the infrastructure, platforms, and systems that support it.
  • Leadership is not dogmatic about what the solution looks like and is willing to adapt to their customers’ needs.
  • It’s thinking about a problem or a customer need in a way you’ve never heard before, but which makes perfect sense once you hear it.

— Build by Tony Fadell

我们终究会死亡,宇宙终究会走向热寂。应把生命看作一场经历;每时每刻,我们都在经历。因此,要压缩每段经历中的信息量。最好的压缩方式,莫过于和一群人一起,做自己认为有意义的事。

近期在读 LLM 中涉及的数学内容。对数(log)这一数学工具,解决了许多概率分布在实际计算中的棘手问题。它只是转换了表达形式,但本质上与原问题等价。

面对难解的问题,似乎可以先将其等价转换为另一种形态,再对这种形态进行处理。这似乎是解决复杂问题最简单、最常用的方法。

最近感悟到的一条人生经验是:少犯错,就能赢。

如何少犯错,很多时候靠的是直觉。

当然,直觉背后或许仍有理性计算在起作用,只是有些判断无法被清晰地量化。此时,真正依靠的就是直觉。

人要有一种信念,它可以是很简单、很朴素的东西。

我的信念是:跟随内心的兴趣与感受前行。从心理学的角度看,一个人顺着内心真正感兴趣的方向做选择,即使最后证明是错的,也更愿意承担相应的后果。

从许多经验来看,很多当下看似无用的东西,终有一天会连成一条线。如果足够幸运,它们还会慢慢织成一张网。

而我的优势,正是曾经编织过无数这样的线。

只有好设计跟坏设计,没有所谓的工程师设计。

大模型的大部分“原始能力”来自 pre-training 形成的高维生成分布;post-training 的核心作用,是用人类目标、可验证 reward 或偏好信号,对这个分布进行重塑,使模型在特定任务上更稳定地产生有用轨迹。

知识的获取,更多是在 pre-training 阶段完成定型;而知识的应用,则更多是在 post-training 阶段完成定型。

学习大模型的训练过程,总能给我一些启发,并反过来滋养我自身的学习。

SFT 学到的更多是一种招式、一套套路,或一种固定模式下的行为;而这种行为模式通常属于较短链路。

但 RL 能够学习更长链路中的思考逻辑,二者在本质上存在差异。它能够在长链路中,面对不断出现的新局面和不同类型的问题时,学习如何进行综合思考。因此,RL 是建立在 SFT 之上的、更高一层的训练逻辑。

人类在学习过程中,也会试图总结出所谓的运行规律,或者所谓的哲学。它本质上是在长链路及其奖励机制下,尝试提炼出一种高度浓缩的规律。

An area of human comparative advantage, for now, is research taste and judgment, including choosing which problems matter, which results to trust, and when an approach is a dead end. —— When AI builds it self by Anthropic

截至 2026 年 6 月,所有编码任务,乃至一切基于电脑操作的工作,都已经可以完整地由“Agent + 模型”的组合来完成,而且其表现必然优于人类。

Agent 对效率的提升毋庸置疑,而这里的演进趋势也已经非常明确:

  1. 从最初由人主导,驱使 Agent 执行任务;
  2. 转变为人与 Agent 共同主导,协同研究问题;
  3. 甚至更进一步,演变为由 Agent 主导、人类辅助,去研究复杂问题。

这是一个必然趋势。这也必然会带来 Agent 结构上的变化:它将从原先“简单 Loop 结构 + Tool Calling”的形态,转向多 Agent Research,以及模型自身能力的持续增强。

而这种模型能力的提升,应该源于对 Hack 类任务的研究。模型在 RL阶段,对这类复杂任务研究得越深入,就越有可能习得这种所谓的研究能力。我猜测,漏洞挖掘会是一个非常好的信号。

因为这需要超长的对话窗口,使模型能够在其中进行多轮实验,并据此完成阶段性总结、信息调查,再继续推进后续总结。

这种模式与漏洞挖掘的过程非常相似。既然人类已经积累了大量与漏洞挖掘相关的补丁经验,完全可以用这些补丁作为 Reward 信号。

花了很多时间学习自然科学的规律,却很少学习那些与人有关的规律:人如何参与自然科学,人与人之间又如何相处、协作与运行。

某种程度上,若想让自己生活得更好,更应该花时间学习和琢磨的,恰恰是这类规律。

年轻的时候,掌握自然科学的规律,往往能直接转化为工作能力,让你赚到钱。

但随着年龄增长,矛盾会逐渐转移到“人生”本身:如何处理与朋友、同事、领导、爱人,以及父母和亲戚之间的关系。

而真正长期塑造一个人对世界的感受的,反而正是这些事情。它们隐秘,却深远。

Until death, all defeat is psychological.