人工智能在医疗保健中的应用AI in Healthcare - Video | Agentic AI Foundation

环球医讯 / AI与医疗健康来源:home.mlops.community美国 - 英语2026-07-19 20:19:23 - 阅读时长29分钟 - 14293字
本文记录了MLOps社区首席幸福工程师德梅特里奥斯·布林克曼对泽特奥健康(Zeteo Health)首席技术官兼首席人工智能官埃里克·兰德里的深度访谈。兰德里分享了他从2005年至今在AI领域的丰富经验,重点探讨了人工智能在医疗保健领域的应用挑战与机遇。他详细介绍了如何为服务不足的社区开发基于RAG的聊天机器人,解决数据隐私、减少LLM幻觉、应对文化偏见等关键问题,并强调了在医疗AI中"做正确的事"比"做更多的事"更为重要,特别是在涉及黑人和西班牙裔等不信任医疗系统的群体时,需要谨慎处理对话设计和信息传递方式以提高患者参与度。
人工智能医疗保健患者健康参与医疗聊天机器人医疗数据隐私大型语言模型幻觉防控服务不足社区医疗远程健康监测
人工智能在医疗保健中的应用

演讲者

埃里克·兰德里

泽特奥健康(Zeteo Health)首席技术官(CTO)/首席人工智能官(CAIO)

埃里克·兰德里是一位拥有25年以上经验的技术专家,专注于医疗、旅游和计算机行业,专长于机器学习工程和基于AI的解决方案。他拥有德克萨斯大学奥斯汀分校软件工程硕士学位(自然语言处理论文课题),拥有三项美国专利,在机器学习工程方面发表了多篇文章,并在2023年应用智能大会、2020年KDD会议和2024年数据科学沙龙发表演讲。他曾是巴比伦健康(Babylon Health)和艾 xpedia的AI工程与对话平台总监,目前担任泽特奥健康首席技术官/首席人工智能官。

德梅特里奥斯·布林克曼

MLOps社区首席幸福工程师

目前,德梅特里奥斯正通过每周在MLOps.community聚会上采访全球专家来深入学习机器学习。他不断学习并参与新活动,让自己感到不适并从错误中学习。他试图将创造力带入生活的各个方面,无论是分析最佳前进路径、克服障碍,还是与女儿一起搭建乐高房子。

摘要

埃里克·兰德里讨论了人工智能在医疗保健领域的整合应用,重点介绍了通过聊天机器人提高患者参与度和管理医疗数据等用例。他探讨了对大型语言模型(LLM)的基准测试和减少幻觉问题的方法,强调了隐私保护和数据本地化的必要性。兰德里坚持亲力亲为地开发人工智能解决方案,并应对医疗创新的复杂性。尽管面临必要限制,他仍强调人工智能在主动参与患者互动和改善健康结果方面的潜力。

逐字稿

埃里克·兰德里 [00:00:00]:

好的。我是埃里克·兰德里,泽特奥健康(Zetao Health)的首席技术官(CTO)兼首席人工智能官(CAIO)。我喜欢美式咖啡。我的意式浓缩咖啡机是我家里最珍贵的物品之一。

德梅特里奥斯 [00:00:16]:

欢迎回到MLOps社区。我们又带来了一期播客。我是你们的主持人,一如既往,我是德梅特里奥斯·奥斯。我们讨论了整个医疗保健领域,将人工智能引入医疗保健空间。高价值的RAG聊天机器人应用,而不是你们通常遇到的那种人力资源部门的垃圾。高价值的用例及其细微差别、伦理问题、对话设计,以及它可能有多么困难。我非常欣赏这一点。他在医疗保健领域从事AI工作已经很久了,我喜欢他仍然亲力亲为地进行构建。

德梅特里奥斯 [00:01:00]:

你可以从我们的谈话中看出,他正在深入其中,他四处"捣鼓"。对于他来说,坐下来成为一名经理或高管可能很容易,但现在他仍然在亲力亲为地构建。所以让我们进入这段对话,一如既往,如果你喜欢,请务必告诉一位朋友,这样我们才能继续这趟成功的旅程。所以我认为我们应该从我们刚才谈论的内容开始,那就是你在2005年进入这个领域,请向我解释,描绘一下当时尝试做机器学习和人工智能的情景是怎样的。

埃里克·兰德里 [00:01:53]:

是的。我是通过在德克萨斯大学的学校工作进入这个领域的。当时,我的研究是关于遗传学科学文章的文档聚类。我的实验基本上是在测试不同的算法。其中大部分是处理数据。自然语言处理通常计算量很大,所以找到计算资源和内存一直受到限制。当时我在Sun Microsystems工作,在家我有一台小MacBook,我会让算法整夜运行,结果有一半时间早上醒来发现堆栈溢出或其他电脑崩溃。

埃里克·兰德里 [00:03:01]:

所以最终,我把很多工作,很多学校作业带到了Sun Microsystems工作。我们有一个装满最新最先进服务器的实验室。你知道,在家需要一整晚的工作,在午餐时间只需几个小时就能完成。不过仍然需要几个小时,是的,而且所有的算法,正如我之前提到的,我用Java编写。所以花了很多时间去理解、阅读研究论文,然后用Java编写证明。很多时候,我会发现论文中的证明实际上是不正确的。不是经常,但有时会这样。所以,你知道,能够快速迭代不同的算法对我来说是相当令人震惊的,但计算能力、内存、数据处理、数据转换和清洗等方面的挑战在当时要大得多。

德梅特里奥斯 [00:04:18]:

是的,人们没有意识到如今使用PyTorch是多么方便。

埃里克·兰德里 [00:04:23]:

是的,我精通Java,弄清楚最优数据结构是什么,如何优化数据压缩等。要实现某些算法,需要将所有数据都放在内存中。所以这经常是一个挑战。

德梅特里奥斯 [00:04:43]:

所以,是的,感觉你在整个职业生涯中一直被非常棘手的问题所吸引,因为现在你在医疗保健领域的AI工作中,这里有很多限制,医疗保健中存在很多困难,无论是数据本身还是你如何使用AI,不同的用例。所以我觉得我们会涉及到很多这些不同的方面,但了解一下你在巴比伦健康(Babylon Health)的最后一份工作会很好,因为我知道你是AI工程总监和对话平台负责人。那是你现在在当前工作中所做的前身。那是什么样的?

埃里克·兰德里 [00:05:35]:

那是两个不同的角色。AI平台团队正在构建一个云无关平台,因为当时我们试图做到云无关。所以我们构建的基础设施能够部署我们的模型,无论是在Azure还是AWS等平台上。所以我们支持所有关于如何优化不同类型部署的挑战,我们有流式处理、Kafka流上的推理。我们有作为服务的推理,还有批处理类型的流式处理。所以我们支持所有这些。

埃里克·兰德里 [00:06:21]:

我们还支持基于云的训练。

德梅特里奥斯 [00:06:25]:

这些是NLP用例。

埃里克·兰德里 [00:06:27]:

是的,全部都是。它是NLP,也是结构化数据。我们有很多医疗数据用于训练模型。所以那是那部分。然后是对话AI,即对话平台。

埃里克·兰德里 [00:06:50]:

我们构建了聊天机器人。那是基于意图的聊天机器人,有人还记得基于意图的聊天机器人吗?所以我们使用开源框架来构建聊天机器人。不幸的是,我们构建了一个包括实时聊天和聊天机器人自动回复的对话平台。如果用户对聊天机器人的回复不满意,他们可以请求转接到实时代理。所以我们围绕所有这些功能构建了一个完整的系统。不幸的是,我们在巴比伦在美国关闭前大约三四个月发布了我们的聊天机器人。但我们的早期迹象表明,我们的全部重点是通过自动化代理将用户/患者从实时代理那里转移开。

埃里克·兰德里 [00:07:59]:

我们能够转移多达40%的用户。这就是这些聊天机器人的真正用例和真正价值。

德梅特里奥斯 [00:08:10]:

是的。而且再说一遍,这就像历史在重演。现在,每个人都明白了,因为我认为每个人都试图在他们的产品上扔一个基于LLM的支持聊天机器人。

埃里克·兰德里 [00:08:25]:

是的,看到迄今为止的进展很有趣,试图理解什么是真正的价值。我的想法开始慢慢演变,你不能仅仅发布一个没有适当控制的基于LLM的聊天机器人。所以现实几乎是介于两者之间的某种东西。我不知道。我还没有完全确定。但我正在尝试一些技术,这些技术可以实现某种混合类型的聊天助手。

德梅特里奥斯 [00:09:13]:

当你说到混合时,你是指基于规则或基于意图加上LLM。

埃里克·兰德里 [00:09:18]:

是的。

德梅特里奥斯 [00:09:19]:

这说得通。是的,你不能让它成为任何东西,否则你就会登上互联网的头版。

埃里克·兰德里 [00:09:25]:

是的,因为...是的,完全正确。

德梅特里奥斯 [00:09:28]:

你说聊天机器人说了不应该说的话,或者基本上就是GPT-4的复读机。

埃里克·兰德里 [00:09:37]:

是的。我的意思是,在理解医疗保健方面,有人以一美元的价格卖了一辆卡车。但在医疗保健中,风险要高得多。所以我们必须把它做对。

德梅特里奥斯 [00:09:50]:

是的。而这又回到了我之前谈到的棘手问题。就像存在真正的伦理问题,当处理你的用例时,可能涉及到人类生命,而相对于...我理解以一美元的价格卖卡车很糟糕,但它不像有人类生命处于危险之中。

埃里克·兰德里 [00:10:10]:

对。是的,完全正确。那是我以前在艾 xpedia旅行部门时经常对团队说的笑点,工程师们往往喜欢过度设计东西。我的笑点经常是,"好吧,如果这个东西坏了,飞机不会从天上掉下来。"在医疗保健领域,我不得不重新考虑这一点,你知道,风险比毁掉某人的假期要高得多。

德梅特里奥斯 [00:10:44]:

完全正确。在艾 xpedia,就像是,好吧,可能是某人的假期,但也许你只是给了他们一个机会去做一些更有趣的事情。但在医疗保健方面,情况就不同了。回到数据方面的一些困难问题,我想我们可能都熟悉PII(个人身份信息),以及它有多么麻烦。所以这首先是问题。但我记得当我之前提到的一位在巴比伦数据工作的朋友杰里米交谈时,他在2020年告诉我,他当时正在研究的一个工程问题是如何将所有在加拿大创建的数据保留在加拿大。他们不想让其他人接触这些数据,因为这是非法的。

德梅特里奥斯 [00:11:42]:

但他仍然希望所有ML工程师能够训练他们的模型,并拥有尽可能强大的数据集,同时不危及加拿大数据集。所以这些都是...是的,像数据访问问题这样不容易解决的问题。

埃里克·兰德里 [00:12:05]:

是的,这是一个真正的挑战。问题是你不能在区域之间传输数据,所以你不能将数据从英国传输到美国来训练模型或对模型进行推理。所以你必须想出策略,如何在开发解决方案时让数据保持原位。很多时候我们有不同的...有时我们有不同的模型,很多时候这是有道理的,因为数据不同,形状不同,可以应用不同的规则。我们还尝试了联邦学习,数据保持在原位。但你训练模型,所以你不会在区域之间传输数据,但你会有"智能体",我想你可以称之为存在于不同区域的智能体,然后传输的是模型权重,以得出最优训练模型。

德梅特里奥斯 [00:13:13]:

这个进展如何?我记得你提到这不是最成功的概念验证。

埃里克·兰德里 [00:13:20]:

它没有继续推进。我认为在这些企业中,不同的事情优先级不同。那实际上从未成为优先事项。但这是一次很棒的实验,我们对所做的工作非常满意,这很酷,因为它不仅适用于区域之间,你还可以在手机上训练模型。所以如果你有100个用户,成千上万的用户,他们的数据永远不会离开他们的设备。但我们可以基于所有这些数据训练一个模型,这更有...

德梅特里奥斯 [00:14:00]:

吸引力,比如医疗保健或类似的东西,比如我和治疗师说的话,我更喜欢这些数据是我的数据,而不必发送出去训练模型等。

埃里克·兰德里 [00:14:15]:

是的。我们的概念验证是关于皮肤癌图像的,拍摄的图像。我们在移动设备上测试了它,训练检测是否有皮肤癌。所以你可以想象这种技术的用途。

德梅特里奥斯 [00:14:33]:

是的,100%。你确实提到了它没有真正成为优先事项。在你领导AI和ML团队的经验中,最大的优先事项是什么,你如何为它们争取支持?你怎么知道哪些应该排在最前面,并能够自信地说,是的,这是我们正在看的指标。我们知道,如果我们这样做,我们可以取得成功。

埃里克·兰德里 [00:15:07]:

是的。你知道,很多这些优先事项是从上而下产生的。所以你有产品经理,基本上在做市场调研,了解资源的最佳用途在哪里。我一直认为我们是平等的合作伙伴,我在这个行业工作了很长时间,我不是产品经理,但我构建了很多产品。所以,你知道,一起,如果你与产品经理有正确的关系,你们可以决定什么是优先事项,挑战是如何平衡这一点与...你希望你的团队感到有能力去实验和探索创造性解决方案。

埃里克·兰德里 [00:16:03]:

所以你如何平衡企业希望你做什么与你认为你可以做什么以及你可以构建什么?这是一个微妙的平衡,当然你必须玩一些政治手段来应对所有这些。最终,希望一切都能顺利。关于你的团队?我一直觉得我的团队应该在边界内有决定他们构建什么的自主权,但它也可以反过来。工程团队应该能够提出新产品和功能。

德梅特里奥斯 [00:16:39]:

你现在在做什么?

埃里克·兰德里 [00:16:41]:

目前我在一家名为泽特奥健康(Zoteo Health)的初创公司工作。我们的重点是为服务不足的社区提供医疗保健,背后的原因是...所以我们想向这些社区提供有关医疗保健的信息,让他们参与医疗保健。有研究表明,参与自己医疗保健的人往往过着更健康的生活,对吧?是的。在这些社区中之所以重要,是因为这些社区,比如黑人和西班牙裔社区,至少在美国,他们不信任医疗系统。我认为大约50%的黑人和西班牙裔不信任医疗系统。这种对系统的不信任导致他们不参与自己的医疗保健。有一项研究,我经常引用,它发布在国家卫生研究院,说在2018年。

埃里克·兰德里 [00:17:53]:

有10万例可预防的死亡,医疗系统为此花费了1000亿美元。因为人们没有参与自己的健康,他们基本上没有服用药物。所以对我来说,这看起来像很容易摘到的果实。每个人都寻找闪亮的物体。我们如何解决癌症?等等?虽然这非常重要,但保持人们参与自己的健康看起来像是一个可以解决的问题。所以这就是我们的重点。我们正在构建的技术基本上是我所说的对话式AI框架。有点...

埃里克·兰德里 [00:18:40]:

主导技术当然是基于RAG的聊天机器人,但它是在一个系统内构建的。所以我在整体上思考这些对话能告诉我们什么,不仅关于个人,而且关于人口中的某些群体和细分。因此我们可以,从这一点出发,开始推断我们如何保持这些人健康。不仅仅是静态分析,我们也会对这些对话进行分析,但要实时。当前的趋势话题是什么,当前的趋势术语是什么,我们能从中了解到什么,以及我们如何采取行动?举一个简单的例子。在德克萨斯州奥斯汀市,目前,比如我在艾 xpedia时做过。

埃里克·兰德里 [00:19:45]:

我们使用Elasticsearch对某些事物进行实时推断。你这样做的方法是在时间上将一个窗口与另一个窗口进行对比。比如最近一周与最近一个月相比,突出的趋势话题或趋势术语是什么?所以你可以想象,在奥斯汀的医疗保健中,本周咳嗽和发烧很流行,碰巧是流感季节。也许我们应该向奥斯汀的人们发送通知,告诉他们应该去接种流感疫苗。这是一个非常简单的例子,但你可以想象我们能从中创建的功能和东西。

德梅特里奥斯 [00:20:36]:

所以,我理解正确的话,参与自己的健康主要是去看医生,服用处方药,就是这些我们可能认为理所当然的事情,但你说这对某些人来说并不常见,你会这么想。

埃里克·兰德里 [00:21:03]:

但,是的,你知道,有些人有...例如糖尿病。你知道,有日常...有些人需要每天提醒测试血糖。你知道,有些人需要提醒,甚至是我。比如,我通常坚持每年的体检,但你知道,它有时会拖延。比如,我通常在夏天做,但去年我是在12月做的。谁知道那几个月会发生什么,对吧?但这只是参与,不仅是在日常思考自己的健康,还包括年度体检,如果你有前列腺癌的话。对于被诊断出患有前列腺癌的人,有一种观点认为其中一些人可以被监测。你知道,没有治疗。他们只是监测自己的健康,需要坚持计划。对吧。以保持健康。

埃里克·兰德里 [00:21:59]:

他们只是监测自己的健康,需要坚持计划。对吧。以保持健康。

德梅特里奥斯 [00:22:12]:

好的。我曾说过一些关于RAG聊天机器人的负面话,因为我认为它们在很大程度上没有经过充分考虑,用例也不是那么高价值。在你的用例中,如果是保持人们参与并让他们服用药物或去看医生,并且它能挽救生命,那么 stakes 很高。我认为这是聊天机器人的一个很好的用途。

埃里克·兰德里 [00:22:49]:

所以你正好戳中了一个痛点。是的,我跟你一样。有太多关于这个的炒作。毫无疑问存在价值,但炒作太多了。我觉得人们对不同类型的检索、所有lang chain和所有这些技术付出了太多关注,而我们还没有真正弄清楚如何充分利用我们已有的东西。让我们退一步,了解我们拥有什么以及如何将其应用于真正的用例。我同意你。人们认为这是魔法。

埃里克·兰德里 [00:23:40]:

它不是...而且...我们之前讨论过防护栏。必须有防护栏,特别是在像你的健康这样后果严重的领域。对吧。我们主要通过通知和信息寻求与我们的人群互动。我的很多实验都是围绕如何限制幻觉,如何对待人们,以及如何让他们参与关于他们健康的对话,让他们对健康感到好奇。

埃里克·兰德里 [00:24:18]:

我们如何引导他们进入关于他们健康的对话?我们有医疗保健提供者和专业人士在我们的团队中。我和他们交谈,令我非常感兴趣的是医生如何看待当有人走进门时,他们如何评估他们,以及如何了解如何最好地帮助和支持他们的健康。所以我一直在做的很多实验,除了如何限制幻觉之外,是如何与他们进行对话,特别是这些不信任医疗系统的服务不足的人群。我们如何获得,你知道,给他们带来信任?首先,我们的知识库是一个经过策划的、可信的知识库。所以我们提供给他们的任何信息都来自这个知识库,并限制知识。基本上,我不使用LLM的知识。我不想要它的知识。我还不如去Google搜索,对吧?我希望解决方案的知识来自我们策划的信息知识库,高质量的数据。

埃里克·兰德里 [00:25:29]:

高质量的数据。对吧。这是我们的医疗保健专业人士建议我们的。对吧。我们如何以对他们有意义的方式给他们这些信息?不会让他们的眼睛在我们给他们一大堆技术信息时变得茫然。我交谈过的医生基本上说,一点一点地给他们需要的信息。有人问,我如何测试前列腺癌?或者我如何测试糖尿病?你不要给他们三段落。你给他们基本信息。

埃里克·兰德里 [00:26:12]:

有三种类型的测试可以进行前列腺癌检测。允许他们随后询问有关PCA测试的更详细问题,然后引导他们完成。提示他们提出下一个问题。这对患者来说比仅仅给他们三段落更有意义,你知道?

德梅特里奥斯 [00:26:36]:

是的。试着让它小块且易于消化。

埃里克·兰德里 [00:26:41]:

是的。对我来说,这是很多挑战,你知道,我看到的很多信息都是关于如何回应一个问题?很好。比如,我们有一种很好的方式来优化问答,但如何优化对话?对吧。所以把它看作是一场对话,而不仅仅是一问一答。对吧?

德梅特里奥斯 [00:27:05]:

是的。这就是关于应该给某人多少信息的理论发挥作用的地方。你不想只是给他们一连串的信息,这对LLM来说很困难,因为它们总是非常啰嗦。

埃里克·兰德里 [00:27:20]:

所以,是的,这是一个挑战。这也是我做了很多实验的地方。是语气,比如你如何与他们交谈?

德梅特里奥斯 [00:27:30]:

我本来想问的,因为服务不足社区或代表性不足社区中存在不同的俚语。你是否尝试使用不同的俚语或口音?这是否太过分了?看起来很做作?你实验过吗?

埃里克·兰德里 [00:27:56]:

是的,不是在那个意义上。我实验的是如何检测基本上那个人是谁。对吧。不一定是...我们应该有一个用户档案,所以我们知道他们的种族,我们知道他们的年龄,但我们如何能推断出不仅教育水平,还有他们希望如何被交谈。对吧。我们不...

埃里克·兰德里 [00:28:30]:

目前,我们的语气基本上是代表我们品牌的标准化语气。对吧。泽特奥的品牌。但我们打算实验关于如何与人们交谈。比如,你,你知道,你想和自己交谈吗?比如,你希望和一个和你有相同语气的人交谈吗?这是你最好回应和参与对话的方式,还是相反的人?你知道,这是我们想要做的实验,对吧?

德梅特里奥斯 [00:29:07]:

是的,如果它像我一样说话,我不会信任它。

埃里克·兰德里 [00:29:12]:

会是,等等。大多数人可能会因为和自己说话而感到毛骨悚然,你知道?

德梅特里奥斯 [00:29:18]:

是的,完全正确。但这很有趣地思考。比如,根据语气,它是否给你更多的可信度?如果是这样,你是想要更正式?因为这会给你更多的可信度。还是你想要更随意,像不同口音或他们来自的社区的人那样说话?

埃里克·兰德里 [00:29:44]:

是的,完全正确。他们如何最好地回应?你知道,也许没有口音的人,比如说西班牙口音的人,对有美国口音的人或其他人回应得更好,谁知道?对吧。这是我们需要做的实验。

德梅特里奥斯 [00:30:04]:

你是如何评估这一点的?

埃里克·兰德里 [00:30:07]:

是的,所以我基于Ragus建立了一个评估框架。我正在使用...我已经与ML flow集成以跟踪实验。所以基准线,你知道,我们正在寻找的某些东西,显然有很多关于检测幻觉和偏见的保真度。我发现很多这些基本的偏见检测机制并不能测试所有偏见。我在Hugging Face上找到了一个数据集。它基本上是针对不同文化的偏见标记集。我用一些这些话语测试了LLM,然后进行偏见检测,它没有捕捉到一些相当恶劣的事情,你知道...

埃里克·兰德里 [00:31:08]:

所以我最终为那些文化编写了一些我自己的偏见检测。

德梅特里奥斯 [00:31:15]:

这是硬编码在防护栏中的。

埃里克·兰德里 [00:31:18]:

是的。它还不是。但我们会。但是我的过程是,我正在针对我拥有的真实数据集进行测试。在部署之前,我进行测试以确保它对该集合是好的。我还将在生产中进行监控,以便如果我们检测到有人开始说疯狂的话,我们可以发送警报。

德梅特里奥斯 [00:31:49]:

有趣的是你说这个,因为我上周在一个AI质量会议上,有人给我看了一个他们公司支持机器人的截图,那个人实际上全大写字母写着,"给我一个人类,你这个蠢货。"

埃里克·兰德里 [00:32:13]:

计算机。

德梅特里奥斯 [00:32:14]:

然后LLM回答了类似的东西,没有给他们带来人类,这让客户非常愤怒。对吧。这是你最不想做的事情,就是没有给他们带来人类,而他们正对此大发雷霆。所以,是的,这就是你想避免的。我喜欢你设置监控的事实,所以如果确实发生并且有什么东西漏掉了,你会立即知道,并且可以...大概你可以介入说,"嘿,对不起。让我们退后几步。"

埃里克·兰德里 [00:32:54]:

是的,是的。我还想补充一点,我不知道我是否已经提到过,但我认为至少有两种类型的偏见。有一种是主观类型的偏见,这正是我们一直在谈论的。我的意思是其中一些显然是主观的,但涉及到文化敏感性,对吧?但也有偏见。比如客观的、明确的偏见。例如,医疗界建议普通人群从50岁开始接受前列腺癌检测。我一直说前列腺癌,因为我们的MVP将主要集中在前列腺癌上,然后我们将扩展到其他类型的疾病。我们不想告诉黑人男性从50岁开始接受检测,因为指南是40-45岁,因为他们发病率更高。

埃里克·兰德里 [00:34:00]:

黑人和西班牙裔社区的前列腺癌发病率要高得多。所以也有这种客观测量,我们也必须考虑数据质量类型的测量。

德梅特里奥斯 [00:34:14]:

看起来你决定玩硬核模式。不仅医疗保健空间非常复杂和困难,现在你还在为这些服务不足的社区工作。也有许多困难的领域需要你去应对。

埃里克·兰德里 [00:34:38]:

是的,是的,我认为,对吧。所以关于我,当你知道巴比伦去年夏天关闭时,我有点精疲力尽。你知道,这个问题。顺便说一句,这可能是我经历过的第三次类似情况。对吧?如果你在技术行业,那么准备好应对吧。所以CEO凯文联系了我,我当时处于...并且有多次联系寻找填补职位的人。

埃里克·兰德里 [00:35:20]:

基本上,这个职位满足了我几个条件。医疗保健,我决定这就是我想参与的领域。你知道,我们医疗系统中的不公平,当然在美国,这引起了我的共鸣。它有点像解决了几个问题,这就是我决定加入的原因。除了...是的,好吧,这也是一个相当有趣的挑战。当我开始思考时,触发点是,"天哪,外面有一些数据集,评估和应用于这个偏见问题会很酷。"而这就是...

埃里克·兰德里 [00:35:58]:

那就是让我下定决心的。我想,好吧,是的,这是一个真正很酷的问题要解决。

德梅特里奥斯 [00:36:05]:

嗯,有趣的是,这不像你必须走出去解决癌症的技术挑战。它更像是技术挑战,如果你能让人们服用药物或扫描他们的心率监测器或其他什么,这些对人们来说是低门槛的事情,那么它就可以导致更长的寿命和更好的结果。所以技术挑战更多是在已经存在于世界上的东西的实施上。对吧。这不像尖端生物科学,或者你必须去发现新药,任何这些。所以这也是我发现有趣的另一点。而且,是的,现在你必须应对更多关于使用什么语气来让人们做事的细微差别。我想...你也带入心理学家来帮忙吗?

埃里克·兰德里 [00:37:12]:

或者...

德梅特里奥斯 [00:37:12]:

或者好的文案撰写者,能向爱斯基摩人卖冰的营销人员?

埃里克·兰德里 [00:37:17]:

是的。是的。我应该说。我应该提到我们确实有一位...我不太知道她的头衔是什么,但她是一位作家,她正在就语气提供建议。基本上我给了她一整套我们聊天机器人的问题和答案,她做了很多修改。所以现在我得回去看看是否能修复它。挑战在于试图找出...

埃里克·兰德里 [00:37:43]:

顺便说一句,我之前说过,我认为提示工程是一个矛盾,因为对我来说,应用到它上的工程原则并不多。你知道,这是一个很好的观点。

德梅特里奥斯 [00:37:59]:

这就像把意大利面扔在墙上。真的。

埃里克·兰德里 [00:38:03]:

也许我做得不对。我不知道。但是,比如...

德梅特里奥斯 [00:38:07]:

是的,所以它...

埃里克·兰德里 [00:38:08]:

是的,我的意思是,它...你看,有趣的是,它似乎在技术上应该是一个容易解决的问题,但改变人们的行为真的非常非常困难。

德梅特里奥斯 [00:38:21]:

是的。

埃里克·兰德里 [00:38:22]:

你知道,就是这样。这让我想起...另一件我们正在研究的事情是,你知道,所有这些可穿戴设备,使用它们来远程监测人们,然后向他们发送通知,并将他们带入聊天机器人,以告知他们从监测设备看到的指标。这实际上是我团队在巴比伦做过的事情。我们正在研究血压的远程监测,我们有一系列数据,如果我们检测到血压超出边界,我们会在应用程序上发送通知,然后这会将他们带入与我们聊天机器人的对话,并告知他们这意味着什么并提供信息。如果他们想与实时代理交谈以安排预约。

埃里克·兰德里 [00:39:26]:

所以我们实际上在泽特奥健康也在研究类似的东西,使用远程监测设备创建新的对话,以便他们再次参与医疗保健。对吧?

德梅特里奥斯 [00:39:44]:

是的,我戴Whoop,当我收到Whoop的通知告诉我睡眠情况时,我觉得有点烦人。我还有一个13个月大的女儿,所以我的睡眠实际上并不太好。我的女儿仍然可能每晚醒来三、四次。她睡眠非常不好,我妻子承担了大部分负担。她是这里的冠军。但我仍然时不时醒来。所以Whoop会给我发送这些通知。

德梅特里奥斯 [00:40:20]:

比如,你昨晚的睡眠可以更好,就像这些被动攻击性的东西,"你今天可能想小睡一下。"是的,就像,老天,我已经感觉很糟糕了。你没有帮助这个情况。就像,你是什么毛病?

埃里克·兰德里 [00:40:33]:

Whoop。你给我...

德梅特里奥斯 [00:40:34]:

所以很多,就像,试图把我击垮。所以我感觉自己因为过去一年从Whoop通知那里遭受的虐待而在精神上更强大了。

埃里克·兰德里 [00:40:48]:

是的。是的。我的一个好朋友,他母亲患有糖尿病,他一直在监测,所以他半夜经常被叫醒,因为她的血糖水平低于某个阈值。所以他不得不想办法安排她的饮食,但他因为母亲不关注自己的健康而失去了睡眠。

德梅特里奥斯 [00:41:09]:

哦,天哪。所以这些都是事情。现在,我想再次谈谈这个评估,因为我想过一件事,我不知道这是否可能。我想你已经看过,当涉及到防护栏,以及...我知道你提到你现在正在使用Ragus。还有其他选择,比如一个叫做Guardrails AI的。我知道Nvidia有Nemo Guardrails。

德梅特里奥斯 [00:41:40]:

有很多,对吧?你有没有想过,嘿,让我们把所有东西都扔进去以防万一,这样它就能捕捉到每一个边缘情况。也许Ragus在这方面更强。然后Guardrails,我们可以设置我们想要的特定防护栏。或者也许,我认为他们有针对不同垂直领域的模板。然后Nemo Guardrails有这个优势。还是说这太冗余和过度了?

埃里克·兰德里 [00:42:09]:

好吧,我想我会描述我的想法和思考过程。所以我正在开发阶段使用Ragus。例如,我创建了一个基准,了解这个东西的行为方式,使用Ragus。我在ML flow中记录这些。所以我有这些指标的历史记录。对吧?所以我有一个基准。具体来说,我开始使用OpenAI chat GPT 3.5。

埃里克·兰德里 [00:42:54]:

我基本上对不同的模型进行了一些经验性的测试,但这个看起来很简单,当时对我来说是最好的。然后我开始研究幻觉。所以我现在有了一个基准,对吧?所以我想要...我从LLM开始。好的。所以我对实际上我能找到的每一个LLM运行了相同的测试。好吧,我应该说那不是风筝。那有点夸张。

埃里克·兰德里 [00:43:30]:

亚马逊Bedrock中的每一个LLM,对吧?

德梅特里奥斯 [00:43:34]:

是的。

埃里克·兰德里 [00:43:36]:

所以我现在有十几个不同模型的基准,以及我关心的关于幻觉的指标,特别是保真度。对吧?这帮助我决定使用哪个LLM。结果是...我想是Anthropic Sonnet,根据我的测试,我会说,不要相信我,相信你自己的数据。外面的每个人,这不是一个简单的通行证。你仍然必须做艰苦的工作。在你的数据上使用它,因为它可能根据你的数据表现不同。这基于该模型创建了一个基准。

埃里克·兰德里 [00:44:25]:

然后我做的下一件事是针对不同的嵌入模型进行测试,用于检索和检索的不同参数,k值等。我已经能够做的是基于我关注的指标逐步移动它。这就是我使用Ragus的方式。我也用它来监控,我不会说,我会说生产,但我们还没有投入生产。我们还没有交付MVP。我们打算在10月份与西奈山医疗中心(Mount Sinai Medical Center)进行试点。所以我们将开始监控。我们可能不会有太多吞吐量来真正告诉我们很多,但至少它会开始给我们数据。

埃里克·兰德里 [00:45:23]:

所以我使用Ragus来对照基准进行测量并在现场进行监控,然后进入关于防护栏的讨论的下一部分。我正在尝试Nemo Guardrails。这是Nvidia的开源项目。我正在研究它的几个方面,我会告诉你为什么我喜欢它的一个原因。所以防护栏基本上,我用它来测试提示注入安全违规,以确保聊天机器人不说愚蠢的话。所以,你知道,防护栏会捕获这一点。你可以更改响应,或者说一些话,比如"抱歉,我不能回应那个",无论什么,像待决定。但我也喜欢它的一点是之前讨论过的内容,我不记得是在线还是离线,关于在基于意图的聊天机器人和基于LLM的生成式聊天机器人之间需要某种东西。

埃里克·兰德里 [00:46:41]:

因为在某些情况下,我需要知道响应会是什么。现在,注意,意图将是预测性的,但至少我知道响应会是什么,因为我自己编写它,或者我们的产品经理或临床人员编写它,如何回应特定意图。所以这就是我打算使用防护栏的方式,不仅用于防护,还用于基于意图的响应类型。

德梅特里奥斯 [00:47:16]:

是的,每当有人想了解关于其他人的信息而不是他们自己时,这确实是一个需要防护栏的情况。但这又变得棘手,因为问题是,"40-45岁的人通常有什么问题?"这类问题可能会出现。但如果问题是,"埃里克有什么问题?"那么聊天机器人应该说,"哦,埃里克很好,你可以自己问他。我不会告诉你关于埃里克的任何事情",但如果问题是,"哦,是的,40-45岁的人通常关注这些事情,或者这些是你所在地区或你所在人口统计数据中健康问题的主要原因,或者与你的体重、身高、背景等有关",那么类型的东西,所以,是的,这是一个思考起来很有趣的问题。我相信一旦你投入生产,你会看到各种人们试图搞乱它的方式。

埃里克·兰德里 [00:48:25]:

老兄,我已经警告过所有人了。我已经做了所有测试。我们有我们的真实数据,就像你知道的,经过医学认证的。我保证你,做这件事很长时间了,我们把它放在那里,面对真实的人。如果你认为它会出错,它肯定会出错。我已经从艰难中学到了这一点。现在,注意,我们不会有像艾 xpedia那样的吞吐量,我们有一些模型暴露给每秒2000个请求。我们不会拥有如果我们一周有2000个请求。

埃里克·兰德里 [00:49:03]:

很好。

德梅特里奥斯 [00:49:04]:

你知道,所以你可以在开始时照看它,特别是开始时。

埃里克·兰德里 [00:49:08]:

是的。

德梅特里奥斯 [00:49:09]:

特别是如果你只与一家医院或医疗中心合作,那么确保"好吧,很好。这没有做我们不希望它做的事情"就很容易了。

埃里克·兰德里 [00:49:23]:

是的,是的。我们会监控。事实上,当我们开始试点时,我们打算从子集开始。从50个用户开始。看看它的行为,看看他们如何反应。他们可能会讨厌它。我们可能不得不重新开始。谁知道?这是一个尽早获得曝光的论点。

埃里克·兰德里 [00:49:50]:

他们可能会喜欢它。我预计会有很多开放性。

德梅特里奥斯 [00:49:55]:

希望如此。

埃里克·兰德里 [00:49:56]:

是的。但我们将会学习,你知道,我们将逐步增加暴露的流量,每轮逐步增加新用户,我们会从中学到更多。对吧?

德梅特里奥斯 [00:50:11]:

是的。我认为听到这些真是太棒了,你正在为RAG聊天机器人添加如此多的价值,我通常会谈论它对公司毫无价值,因为你得到的是人力资源体验,就像是,太好了。现在,你花了所有时间,所有精力在那个RAG聊天机器人上,而你的员工知道他们有12或15天的假期,你本可以用搜索解决。但这种尝试让人们更多地参与自己医疗保健的主动体验引起了我的共鸣。我喜欢这个愿景,感谢你来到这里,埃里克。

埃里克·兰德里 [00:50:52]:

非常感谢。

【全文结束】