plmsmile
plmsmile
AI & ML interests
None yet
Recent Activity
upvoted a paper about 1 month ago
Explore More, Drift Less: Outcome-Only Reinforcement Learning Can Suffice for Long-Horizon Interactive Agents new activity 9 months ago
microsoft/FrogBoss-32B-2510:Will plan to release the FeatAdd 1.2k SFT dataset?Organizations
None yet