ComfyUI
任何一个人,都要必须养成自学的习惯,即使是今天在学校的学生,也要养成自学的习惯,因为迟早总要离开学校的!自学,就是一种独立学习,独立思考的能力。行路,还是要靠行路人自己。—— 华罗庚 当工作流开始“看得见”:为什么 ComfyUI 会让很多创作者一用就回不去在 AI 内容生成这条路上,很多工具都在努力做一件事:让事情变简单。 而 ComfyUI 的气质有点不一样。它当然也希望你能顺利开始,但它更在意的,似乎不是把一切都藏起来,而是把那些原本埋在黑箱里的过程,一步步摆到你面前。模型怎么接,参数怎么走,节点怎么串,哪一段被重跑,哪一段被复用,整个工作流像电路图一样摊开,既不躲闪,也不含糊。 这也是它最吸引人的地方。 Comfy-Org/ComfyUI 在仓库 description 里把自己定义为:The most powerful and modular diffusion model GUI, api and backend with a graph/nodes interface.而 README 里的第一句则更进一步,把它称作:The most powerful...
prime-agent
保持和培养每个学生的自尊心,取决于教师如何看待学生的个人学习成绩。—— 苏霍姆林斯基 当一个 Agent 不只会接指令,而是开始“长期工作”:Prime Agent 想把自主性这件事做深一点很多人第一次接触 coding agent 时,都会有一种新鲜感:它能写代码、能跑命令、能改文件,甚至还能帮你梳理思路。可真正多用几次之后,另一个问题很快就会浮上来——它能不能持续工作,而不是只完成一次对话里的几步动作? 一次性回答和长期推进,其实是两种完全不同的能力。 前者更像一个聪明的即时助手,后者则更接近一个真正参与工作流的执行者:它要记得上下文,保存状态,拆分任务,后台运行,复用经验,还得在中断、恢复、重新接管之后继续向前。也正是在这条路线上,PrimeIntellect-ai/prime-agent 显得格外有辨识度。 它的 description 很直接:A self-improving RLM agent for coding workflows and long-running autonomous tasks. 这句话里有两个关键词特别醒目: self-improvin...
google-skills
在今天和明天之间,有一段很长的时间;趁你还有精神的时候,学习迅速地办事。—— 歌德 当 Google 把“技能”做成仓库:AI Agent 不再只会聊天,而是开始学会按产品线做事如果说过去很多人对 AI Agent 的期待,还停留在“它能不能更聪明地回答问题”,那么现在,另一件事正在变得越来越重要: 它能不能真的把事做起来。 不是泛泛地懂一点概念,不是只会在对话里讲原理,而是能围绕具体产品、具体平台、具体工作流,拿出一套可安装、可调用、可复用的执行能力。也正是在这个方向上,google/skills 这个仓库显得很有代表性。 它的 description 很简洁:Agent Skills for Google products and technologies。 这句话看上去平平无奇,实际上很有分量。因为它意味着,这个仓库关心的不是一个抽象的“万能 Agent”,而是让 Agent 围绕 Google 产品与技术体系,逐渐长出一套成体系的技能集合。尤其是当 README 进一步明确提到其中包括 Google Cloud 时,这种“面向真实产品生态的技能化组织方式”就更清楚了。...
authentik
学会学习的人,是非常幸福的人。—— 米南德 authentik:把零散认证协议、入口和身份流,粘成一套真正能落地的 SSO 体系在很多基础设施项目里,最难的一件事往往不是“有没有功能”,而是“能不能把那些本来就复杂、分散、彼此不太友好的东西,真正粘起来”。 身份认证这件事尤其如此。 系统多了,登录方式多了,协议多了,用户入口多了,管理需求也跟着变得层层叠叠。你会发现,认证从来不是单独的一块拼图,它更像是一堆已经摆上桌的拼图边角:SAML 一块,OAuth2/OIDC 一块,LDAP 一块,RADIUS 一块,代理入口又是一块,自托管环境和大规模生产环境又是另一块。真正费劲的,往往不是再多支持一个协议,而是把这些东西接稳、接顺、接成一套能工作的整体。 authentik 的仓库 description 很短,只有一句: The authentication glue you need. 这句话写得很轻,但其实很准。它不是在强调自己多么花哨,而是在强调自己扮演的角色:那个把认证体系粘起来的胶水。 项目地址:/goauthentik/authentik...
ADR
学习专看文学书,也是不好的。先前的文学青年,往往厌恶数学、理化、史地、生物学,以为这些都无足轻重,后来变成连常识也没有。——鲁迅 当 AI Agent 走进企业环境,安全问题就不再只是“提示词防护”那么简单过去一段时间,大家谈 AI Agent,常常会先聊能力:它能不能写代码,能不能调工具,能不能把任务一步步跑通。 可一旦 Agent 真正进入企业环境,问题的重心就会悄悄变化。 这时候,大家开始关心的已经不是“它会不会做”,而是“它到底做了什么”“它为什么这么做”“它有没有被带偏”“它会不会在看起来正常的流程里做出不安全的动作”。当 Agent 能调用工具、接触代码、访问工作流、读取上下文,它就不再只是一个会回答问题的模型外壳,而更像是一个会行动、会决策、会被诱导、也可能会越界的执行者。 uber/ADR 这套项目,正是冲着这个问题来的。 ADR,全称 Agentic AI Detection and Response。从仓库 description 到 README,它给自己的定位都非常明确:这是一套面向企业 AI Agent 的安全系统,核心围绕 observabilit...
TencentDB-Agent-Memory
努力学习,勤奋工作,让青春更加光彩。——王光美 当 AI 团队终于开始“长记性”:TencentDB Agent Memory 想解决的,其实不是聊天,而是经验流失很多人用 Agent 的第一感受都很相似:它聪明、反应快、执行力强,但也有一个让人哭笑不得的问题——总像是刚刚失忆过一次。 上一个会话里刚讲清楚的项目背景,下一次还要再说一遍;已经读过的文档,换个 Agent 又得从头看;好不容易总结出的处理套路,往往还没来得及沉淀,就又散落在一轮轮对话里。于是你会发现,重复劳动并不是因为 Agent 不努力,而是因为它的经验没有真正留下来。 TencentDB Agent Memory 想做的,正是把这件事掰正。 它把 conversations、docs 和 code 变成四类可复用的 memory assets:Chat Memory、Skill、LLM-Wiki、Code-Graph。这些资产不是零散地漂浮着,而是可以被治理、共享、分配给不同 Agent 与框架使用。换句话说,它不只是让 Agent “记住一点东西”,而是试图为一个 Agent 团队准备一套可以长期积累的记...
pdf-inspector
人生最宝贵的是生命,人生最需要的是学习,人生最愉快的是工作,人生最重要的是友谊。——斯大林 当 PDF 不再一股脑丢给 OCR:认识一下 pdf-inspector很多 PDF 处理流程里,最贵的那一步,往往不是“读文件”,而是“看不清就全送去 OCR”。 这件事听上去很自然,做起来也很省心:PDF 来了,扔进 OCR,等结果出来。但问题也很明显——有些 PDF 根本不是扫描件,它本来就带着清清楚楚的文本层;如果还是按同样的重型流程处理,时间和成本都会被悄悄放大。 pdf-inspector 想解决的,正是这个环节里的“误伤”。 项目地址:/firecrawl/pdf-inspector 它是一个用 Rust 编写的 PDF 检查与提取库,核心目标很直接:先判断 PDF 到底是什么类型,再决定后续该怎么走。README 对它的描述非常清楚——它可以做 PDF 分类、文本提取,并且能智能识别一个 PDF 是扫描件还是文本型文档,从而帮助上层流程做更聪明的路由决策。 它不是在“读取 PDF”,它更像是在“打量 PDF”如果把普通 PDF 处理工具比作一位埋头苦...
openwork
你们要学习思考,然后再来写作。——布瓦罗 当 AI 工作流终于可以被真正“共享”:OpenWork 想做的不只是一个桌面应用项目地址:https://github.com/different-ai/openwork 这几年,越来越多人开始把 AI 真正带进日常工作里。问题也随之变得具体起来:技能怎么复用,MCP 怎么共享,连接过的服务能不能在不同工具之间通用,团队里一个人搭好的能力,能不能别总是从头再来一遍。 OpenWork 看上去,正是奔着这些现实问题去的。 从仓库 description 来看,它的定位非常醒目:Claude Cowork 的开源替代方案,而且基于 opencode 驱动。 README 则把这个方向进一步展开:OpenWork 是一个免费、开源的桌面应用,专门用于分享 AI 工作流,并且同时面向 macOS、Windows 和 Linux。 这很重要。因为它一上来就没有把自己说成“另一个 AI 聊天客户端”,而是把重心放在了工作流共享上。也就是说,它关心的不是你跟某个模型说了什么,而是你已经沉淀出来的那套能力,能不能跨工具、跨同事、跨机器继续活着。 它...
airllm
礼貌是一种语言。它的规则与实行,主要要从观察,从那些有教养的人们举止上去学习。——洛克 https://github.com/lyogavin/airllm 当大模型不再嫌你的显卡小:AirLLM 想把超大模型塞进普通人的机器里项目地址:https://github.com/lyogavin/airllm 大语言模型发展到今天,常常会给人一种微妙的距离感。模型越来越大,参数越来越夸张,名字里动不动就是几十 B、几百 B,仿佛每一次新能力的出现,都在悄悄抬高硬件门槛。很多人刚燃起一点“我也想本地跑跑看”的兴趣,转头一看显存要求,热情立刻被现实按回桌面。 AirLLM 的出现,几乎就是冲着这种落差去的。 它在仓库 description 里的自我介绍非常干脆:单张 4GB GPU 跑 70B 推理。README 开头则把这件事说得更完整:它可以大幅降低推理内存占用,让 70B 大模型在单张 4GB GPU 卡上运行,而且不需要量化、蒸馏或剪枝。更进一步,README 甚至提到,你还可以在约 8GB 显存上运行 405B Llama 3.1。 这类说法会让人第一反应是:这怎么做到的...
kaneo
青年是学习智慧的时期,中年是付诸实践的时期。——卢梭 https://github.com/usekaneo/kaneo 当项目管理工具终于学会克制:Kaneo 想做那个“不碍事”的存在项目地址:https://github.com/usekaneo/kaneo 项目管理工具这几年似乎越来越擅长一件事:把“帮助协作”做成“制造负担”。页面越来越满,按钮越来越多,通知越来越勤,流程越来越长。你本来只是想推进工作,结果却先被工具要求适应它的节奏、它的逻辑、它的仪式感。 Kaneo 对这种局面显然不太满意。 从仓库 description 来看,它给自己的定位相当有态度:All you need. Nothing you don’t. 再往下补上一句,意思就更完整了:这是一款为你服务,而不是跟你作对的开源项目管理工具。README 的开头也延续了同样的思路——在多年使用那些臃肿、复杂、容易分散注意力的平台之后,Kaneo 想做点不一样的东西。 它不是想再造一个更大的系统,而是想把“够用”“顺手”“不打扰”重新捡回来。 Kaneo 讨厌的,不是功能少,而是功能太多README 在 “...
