Deep Noodle
May 29, 2023
Direct Preference Optimization takes the reward model out of RLHF
May 27, 2022
FlashAttention speeds up attention by moving less memory, not less math