Narutatsu Ri
narutatsuri
AI & ML interests
None yet
Organizations
Speak Easy
-
Speak Easy: Eliciting Harmful Jailbreaks from LLMs with Simple Interactions
Paper • 2502.04322 • Published • 3 -
narutatsuri/evaluation-actionable
Text Classification • 8B • Updated • 4 -
narutatsuri/evaluation-informative
Text Classification • 8B • Updated • 6 -
narutatsuri/response_selection_model-actionable
Text Classification • 8B • Updated • 6
Do Thinking Tokens Help with Safety?
Speak Easy
-
Speak Easy: Eliciting Harmful Jailbreaks from LLMs with Simple Interactions
Paper • 2502.04322 • Published • 3 -
narutatsuri/evaluation-actionable
Text Classification • 8B • Updated • 4 -
narutatsuri/evaluation-informative
Text Classification • 8B • Updated • 6 -
narutatsuri/response_selection_model-actionable
Text Classification • 8B • Updated • 6
models 4
narutatsuri/evaluation-informative
Text Classification • 8B • Updated • 6
narutatsuri/evaluation-actionable
Text Classification • 8B • Updated • 4
narutatsuri/response_selection_model-informative
Text Classification • 8B • Updated • 6
narutatsuri/response_selection_model-actionable
Text Classification • 8B • Updated • 6