Hacker News AI· andrew_zhong·· 2026-03-26评分41
Show HN: Robust LLM extractor for websites in TypeScript
摘要
我们一直构建数据管道,爬取网站并提取结构化数据。如果你做过类似工作,知道其中的艰辛:你编写CSS选择器,网站布局改变,到2点整,一切崩溃,你早上要重写解析器。LLMs似乎是个显而易见的解决办法——把HTML扔给GPT,让它输出JSON。但实际操作起来比想象中更困难: - 原始HTML满是导航栏、页脚和追踪垃圾,消耗你的token预算。一个典型的产品页面是80%个底噪。 - LLMs返回的JSON格式更常出错,尤其是嵌套数组和复杂结构。一个错误的括号,你的管道就崩溃了。 - 相对URL、markdown转义链接、追踪参数——这些“小”URL问题在处理数千页时会迅速累积。 - 你最终要写同样的样板代码:HTML清理 → markdown转换 → LLM调用 → JSON解析 → 错误恢复 → 模式验证。
推荐理由
请对照Hacker News AI原文,核对完整说明及适用条件。
本站只提供摘要与原文入口。完整内容请阅读原文。
来源:Hacker News AI · github.com