Gitstar Ranking
Users
Organizations
Repositories
Rankings
Users
Organizations
Repositories
Sign in with GitHub
stophobia
Fetched on 2026/08/16 13:41
stophobia
/
LLMs-Finetuning-Safety
We jailbreak GPT-3.5 Turbo’s safety guardrails by fine-tuning it on only 10 adversarially designed examples, at a cost of less than $0.20 via OpenAI’s APIs. -
View it on GitHub
https://llm-tuning-safety.github.io/
Star
1
Rank
6255410