<?xml version="1.0" encoding="UTF-8"?>
<rss version="2.0"><channel><description>CS PhD @ Stanford AI Lab, Stanford NLP. Prev Google DeepMind.&#xA;&#xA;https://ai.stanford.edu/~kzliu</description><link>https://bsky.app/profile/kzliu.bsky.social</link><title>@kzliu.bsky.social - Ken Liu</title><item><link>https://bsky.app/profile/kzliu.bsky.social/post/3lxd3b6nlcc2k</link><description>New paper! We explore a radical paradigm for AI evals: assessing LLMs on *unsolved* questions.&#xA;&#xA;Instead of artificially difficult exams where progress ≠ value, we assess LLMs on organic, unsolved problems via reference-free LLM validation &amp; community verification. LLMs solved ~10/500 so far:</description><pubDate>26 Aug 2025 17:50 +0000</pubDate><guid isPermaLink="false">at://did:plc:l3juojdkfdbepmj7aqctgcap/app.bsky.feed.post/3lxd3b6nlcc2k</guid></item><item><link>https://bsky.app/profile/kzliu.bsky.social/post/3lbiqad4zik2n</link><description>go.bsky.app/AKGJ82V&#xA;https://go.bsky.app/AKGJ82V</description><pubDate>22 Nov 2024 00:34 +0000</pubDate><guid isPermaLink="false">at://did:plc:l3juojdkfdbepmj7aqctgcap/app.bsky.feed.post/3lbiqad4zik2n</guid></item><item><link>https://bsky.app/profile/kzliu.bsky.social/post/3lbiaxhbmww2y</link><description>hi</description><pubDate>21 Nov 2024 20:01 +0000</pubDate><guid isPermaLink="false">at://did:plc:l3juojdkfdbepmj7aqctgcap/app.bsky.feed.post/3lbiaxhbmww2y</guid></item></channel></rss>