Skip to content
AI情报2026年8月19日AI情报
文章

LLM 看到好假设时能认出来吗?在科学假设排序中,Logit-Based Energy Scoring 优于提示式 LLM-as-Judge

公告类型:新 摘要:大型语言模型(LLM)越来越多地被用于科学假设生成。然而,评估生成的假设对于可信的 AI 驱动科学工作流程仍然是一个挑战。现有方法通常使用 LLM 作为评审,或依赖语义相似性,这可能偏向于熟悉的想法而非新颖的想法。我们提出了一种基于 logit 的能量评分方法

Frontier 编辑部来源: arXiv
01

来源简报

LLM 看到好假设时能认出来吗?在科学假设排序中,Logit-Based Energy Scoring 优于提示式 LLM-as-Judge: 公告类型:新 摘要:大型语言模型(LLM)越来越多地被用于科学假设生成。然而,评估生成的假设对于可信的 AI 驱动科学工作流程仍然是一个挑战。现有方法通常使用 LLM 作为评审,或依赖语义相似性,这可能偏向于熟悉的想法而非新颖的想法。我们提出了一种基于 logit 的能量评分方法