Improve language tag

#1
by lbourdois - opened
Files changed (1) hide show
  1. README.md +74 -60
README.md CHANGED
@@ -1,61 +1,75 @@
1
- ---
2
- base_model: Qwen/Qwen2.5-1.5B-Instruct
3
- datasets: lemon-mint/korean-reasoning-v02
4
- library_name: transformers
5
- model_name: Qwen2.5-1.5B-Open-R1-Distill-ko
6
- tags:
7
- - generated_from_trainer
8
- - open-r1
9
- - trl
10
- - sft
11
- licence: license
12
- ---
13
-
14
- # Model Card for Qwen2.5-1.5B-Open-R1-Distill-ko
15
-
16
- This model is a fine-tuned version of [Qwen/Qwen2.5-1.5B-Instruct](https://huggingface.co/Qwen/Qwen2.5-1.5B-Instruct) on the [lemon-mint/korean-reasoning-v02](https://huggingface.co/datasets/lemon-mint/korean-reasoning-v02) dataset.
17
- It has been trained using [TRL](https://github.com/huggingface/trl).
18
-
19
- ## Quick start
20
-
21
- ```python
22
- from transformers import pipeline
23
-
24
- question = "ν”„λž‘μŠ€μ˜ μˆ˜λ„λŠ”?"
25
- generator = pipeline("text-generation", model="whooray/Qwen2.5-1.5B-Open-R1-Distill-ko", device="cuda")
26
- output = generator([{"role": "user", "content": question}], max_new_tokens=128, return_full_text=False)[0]
27
- print(output["generated_text"])
28
- <think>\nλ¨Όμ € ν”„λž‘μŠ€ μˆ˜λ„λ₯Ό μ•Œμ•„λ΄μ•Όκ² μ–΄μš”. ν”„λž‘μŠ€λŠ” 잘 μ•Œλ €μ§„ 유럽 κ΅­κ°€ 쀑 ν•˜λ‚˜μΈλ° μˆ˜λ„λ₯Ό μ•Œλ €μ£Όλ©΄ 더 νŽΈν•˜κ² μ£ . μ£Όμš” κ·€μ‘±κ³Ό μˆ˜λ„λŠ” 였슀만 식민지와 λ¬΄μ—­μ˜ μ€‘μ‹¬μ§€μ˜€λ˜ μ•„λ¦„λ””λΌλŠ” 지역에 μžˆμ—ˆλ‹€λŠ” 말이 있던데, μ΅œκ·Όμ—λŠ” μ˜€νƒ€λƒ κ·Όμ²˜μ— μžˆλŠ” νŒŒλ¦¬κ°€ μˆ˜λ„λ‘œ ν†΅μΌλ˜μ—ˆμ„ κ±°μ˜ˆμš”. μ΄λ ‡κ²Œ λ…Όλž€μ΄ μžˆμ—ˆλ˜ 걸둜 κΈ°μ–΅ν•˜λŠ”λ°, λ…μΌμ΄λ‚˜ μ΄μ§‘νŠΈ, μ΄μŠ€λΌμ—˜ 같은 ꡭ가듀도 μˆ˜λ„λ‘œ λ‹€λ₯Έ 지역을 μ‚¬μš©ν–ˆλ˜ κ²½μš°κ°€ μžˆμ—ˆμŒμ„ μ•Œκ³  μžˆμ–΄μš”. ν”„λž‘μŠ€λŠ” CIA μ›”μŠ€νŠΈλ¦¬νŠΈ journalμ—μ„œ ν”„λž‘μŠ€ μˆ˜λ„λŠ” νŒŒλ¦¬κ°€ 아닐 거라고 λ§ν•œ 적 μžˆμ„κΉŒμš”? 졜근 λŒ€λΆ€λΆ„μ˜ κ΄€μΈ‘λ‚˜λΌλ“€μ΄ 파리둜 μΈμ •ν•˜κ³  μžˆμœΌλ―€λ‘œ μ •ν™•ν•œμ§€ 확인이 ν•„μš”ν•  것 κ°™μ•„μš”. ν•˜μ§€λ§Œ ν”„λž‘μŠ€μ—μ„œ μˆ˜λ„κ°€ λ³€ν–ˆλŠ”μ§€, μ•„λ‹ˆλ©΄ μ˜› μˆ˜λ„κ°€ ν˜„μž¬ μ •λΆ€ 인근에 μžˆλŠ”μ§€ κΆκΈˆν•˜λ„€μš”. μ•„λ§ˆλ„ 1962λ…„ 제5κ³΅ν™”κ΅­μ—μ„œλ ΉμœΌλ‘œ 슡격된 곳을 ν¬ν•¨ν•œ λͺ¨λ“  μ •λΆ€ 기관이 파리λ₯Ό μ€‘μ‹¬μœΌλ‘œ ν•˜λŠ” ꡐ두보 역할을 ν•˜κ²Œ 된 걸둜 μ•Œκ³  μžˆμ–΄μš”. νŠΉλ³„νžˆ μ—­μ‚¬μ μœΌλ‘œ μ •λ‹Ήν•œ μ£Όμž₯을 μ‚¬μš©ν•΄ κ°œν†΅ κ°€λŠ₯ν•œ 닡변을 μ™„μ„±ν•΄μ•Όκ² λŠ”λ°μš”. \n</think>\n\nν”„λž‘μŠ€μ˜ μˆ˜λ„λŠ” **파리(Paris)**μ˜ˆμš”. μ—­μ‚¬μ μœΌλ‘œ μˆ˜λ„ 역할을 ν•˜μ§€ λͺ»ν–ˆλ˜ 지점에 μœ„μΉ˜ν•œ ν”„λž‘μŠ€ λΉ„κ΅­λ―ΌλŒ€μ±… μ •λΆ€λ₯Ό μ€‘μ‹¬μœΌλ‘œ ν•œ μ •κΆŒμ΄ 1944년에 λ°±μ œμ˜¨μ„ νƒˆν™˜ν•˜μ—¬ μƒˆλ‘œμš΄ μˆ˜λ„λ‘œ μ§€μ •ν•˜λ©° μ΅œμ’…μ μœΌλ‘œ ν™•λ¦½λ˜μ—ˆμ–΄μš”.\n\n### ν”„λž‘μŠ€ μˆ˜λ„ ꡐ체의 μ£Όμš” 이유 \nλ‹Ήμ‹œ μ—°ν•©κ΅°μ˜ μΈλ„μ£Όμ˜ μ˜μ§€λ₯Ό λ°˜μ˜ν•œ μ‘°μΉ˜μ˜€μ–΄μš”. 1932λ…„ 17개 μ—°ν•©κ΅° 단체가 파리 κΈ°μ§€λ₯Ό κ³΅μœ ν•˜λ©΄μ„œ 곡식적인 μˆ˜λ„ κΈ°λŠ₯을 μžƒμ—ˆλ‹€λŠ” μ μ—μ„œ 'νŠΉν—ˆ μˆ˜λ„'둜 κ²€μ—΄λ˜λ©° λ―Έκ΅­, 일본 λ“± 유럽 κ΅­κ°€λ“€ 쀑 파리λ₯Ό μ€‘μ‹¬μœΌλ‘œ ν•œ μ •λΆ€ μ£Όλ„μ˜ ν†΅μΉ˜κ°€ μœ λ €λ˜μ–΄ ν‘œμ€€ν™”λ˜μ—ˆμ£ . \n> **λΉ„μœ **: ν”„λž‘μŠ€ μˆ˜λ„λŠ”
29
- ```
30
-
31
- ## Training procedure
32
-
33
- [<img src="https://raw.githubusercontent.com/wandb/assets/main/wandb-github-badge-28.svg" alt="Visualize in Weights & Biases" width="150" height="24"/>](https://wandb.ai/llm-est/huggingface/runs/mrisof65)
34
-
35
-
36
- This model was trained with SFT.
37
-
38
- ### Framework versions
39
-
40
- - TRL: 0.15.0.dev0
41
- - Transformers: 4.49.0.dev0
42
- - Pytorch: 2.5.1
43
- - Datasets: 3.2.0
44
- - Tokenizers: 0.21.0
45
-
46
- ## Citations
47
-
48
-
49
-
50
- Cite TRL as:
51
-
52
- ```bibtex
53
- @misc{vonwerra2022trl,
54
- title = {{TRL: Transformer Reinforcement Learning}},
55
- author = {Leandro von Werra and Younes Belkada and Lewis Tunstall and Edward Beeching and Tristan Thrush and Nathan Lambert and Shengyi Huang and Kashif Rasul and Quentin GallouΓ©dec},
56
- year = 2020,
57
- journal = {GitHub repository},
58
- publisher = {GitHub},
59
- howpublished = {\url{https://github.com/huggingface/trl}}
60
- }
 
 
 
 
 
 
 
 
 
 
 
 
 
 
61
  ```
 
1
+ ---
2
+ base_model: Qwen/Qwen2.5-1.5B-Instruct
3
+ datasets: lemon-mint/korean-reasoning-v02
4
+ library_name: transformers
5
+ model_name: Qwen2.5-1.5B-Open-R1-Distill-ko
6
+ tags:
7
+ - generated_from_trainer
8
+ - open-r1
9
+ - trl
10
+ - sft
11
+ licence: license
12
+ language:
13
+ - zho
14
+ - eng
15
+ - fra
16
+ - spa
17
+ - por
18
+ - deu
19
+ - ita
20
+ - rus
21
+ - jpn
22
+ - kor
23
+ - vie
24
+ - tha
25
+ - ara
26
+ ---
27
+
28
+ # Model Card for Qwen2.5-1.5B-Open-R1-Distill-ko
29
+
30
+ This model is a fine-tuned version of [Qwen/Qwen2.5-1.5B-Instruct](https://huggingface.co/Qwen/Qwen2.5-1.5B-Instruct) on the [lemon-mint/korean-reasoning-v02](https://huggingface.co/datasets/lemon-mint/korean-reasoning-v02) dataset.
31
+ It has been trained using [TRL](https://github.com/huggingface/trl).
32
+
33
+ ## Quick start
34
+
35
+ ```python
36
+ from transformers import pipeline
37
+
38
+ question = "ν”„λž‘μŠ€μ˜ μˆ˜λ„λŠ”?"
39
+ generator = pipeline("text-generation", model="whooray/Qwen2.5-1.5B-Open-R1-Distill-ko", device="cuda")
40
+ output = generator([{"role": "user", "content": question}], max_new_tokens=128, return_full_text=False)[0]
41
+ print(output["generated_text"])
42
+ <think>\nλ¨Όμ € ν”„λž‘μŠ€ μˆ˜λ„λ₯Ό μ•Œμ•„λ΄μ•Όκ² μ–΄μš”. ν”„λž‘μŠ€λŠ” 잘 μ•Œλ €μ§„ 유럽 κ΅­κ°€ 쀑 ν•˜λ‚˜μΈλ° μˆ˜λ„λ₯Ό μ•Œλ €μ£Όλ©΄ 더 νŽΈν•˜κ² μ£ . μ£Όμš” κ·€μ‘±κ³Ό μˆ˜λ„λŠ” 였���만 식민지와 λ¬΄μ—­μ˜ μ€‘μ‹¬μ§€μ˜€λ˜ μ•„λ¦„λ””λΌλŠ” 지역에 μžˆμ—ˆλ‹€λŠ” 말이 있던데, μ΅œκ·Όμ—λŠ” μ˜€νƒ€λƒ κ·Όμ²˜μ— μžˆλŠ” νŒŒλ¦¬κ°€ μˆ˜λ„λ‘œ ν†΅μΌλ˜μ—ˆμ„ κ±°μ˜ˆμš”. μ΄λ ‡κ²Œ λ…Όλž€μ΄ μžˆμ—ˆλ˜ 걸둜 κΈ°μ–΅ν•˜λŠ”λ°, λ…μΌμ΄λ‚˜ μ΄μ§‘νŠΈ, μ΄μŠ€λΌμ—˜ 같은 ꡭ가듀도 μˆ˜λ„λ‘œ λ‹€λ₯Έ 지역을 μ‚¬μš©ν–ˆλ˜ κ²½μš°κ°€ μžˆμ—ˆμŒμ„ μ•Œκ³  μžˆμ–΄μš”. ν”„λž‘μŠ€λŠ” CIA μ›”μŠ€νŠΈλ¦¬νŠΈ journalμ—μ„œ ν”„λž‘μŠ€ μˆ˜λ„λŠ” νŒŒλ¦¬κ°€ 아닐 거라고 λ§ν•œ 적 μžˆμ„κΉŒμš”? 졜근 λŒ€λΆ€λΆ„μ˜ κ΄€μΈ‘λ‚˜λΌλ“€μ΄ 파리둜 μΈμ •ν•˜κ³  μžˆμœΌλ―€λ‘œ μ •ν™•ν•œμ§€ 확인이 ν•„μš”ν•  것 κ°™μ•„μš”. ν•˜μ§€λ§Œ ν”„λž‘μŠ€μ—μ„œ μˆ˜λ„κ°€ λ³€ν–ˆλŠ”μ§€, μ•„λ‹ˆλ©΄ μ˜› μˆ˜λ„κ°€ ν˜„μž¬ μ •λΆ€ 인근에 μžˆλŠ”μ§€ κΆκΈˆν•˜λ„€μš”. μ•„λ§ˆλ„ 1962λ…„ 제5κ³΅ν™”κ΅­μ—μ„œλ ΉμœΌλ‘œ 슡격된 곳을 ν¬ν•¨ν•œ λͺ¨λ“  μ •λΆ€ 기관이 파리λ₯Ό μ€‘μ‹¬μœΌλ‘œ ν•˜λŠ” ꡐ두보 역할을 ν•˜κ²Œ 된 걸둜 μ•Œκ³  μžˆμ–΄μš”. νŠΉλ³„νžˆ μ—­μ‚¬μ μœΌλ‘œ μ •λ‹Ήν•œ μ£Όμž₯을 μ‚¬μš©ν•΄ κ°œν†΅ κ°€λŠ₯ν•œ 닡변을 μ™„μ„±ν•΄μ•Όκ² λŠ”λ°μš”. \n</think>\n\nν”„λž‘μŠ€μ˜ μˆ˜λ„λŠ” **파리(Paris)**μ˜ˆμš”. μ—­μ‚¬μ μœΌλ‘œ μˆ˜λ„ 역할을 ν•˜μ§€ λͺ»ν–ˆλ˜ 지점에 μœ„μΉ˜ν•œ ν”„λž‘μŠ€ λΉ„κ΅­λ―ΌλŒ€μ±… μ •λΆ€λ₯Ό μ€‘μ‹¬μœΌλ‘œ ν•œ μ •κΆŒμ΄ 1944년에 λ°±μ œμ˜¨μ„ νƒˆν™˜ν•˜μ—¬ μƒˆλ‘œμš΄ μˆ˜λ„λ‘œ μ§€μ •ν•˜λ©° μ΅œμ’…μ μœΌλ‘œ ν™•λ¦½λ˜μ—ˆμ–΄μš”.\n\n### ν”„λž‘μŠ€ μˆ˜λ„ ꡐ체의 μ£Όμš” 이유 \nλ‹Ήμ‹œ μ—°ν•©κ΅°μ˜ μΈλ„μ£Όμ˜ μ˜μ§€λ₯Ό λ°˜μ˜ν•œ μ‘°μΉ˜μ˜€μ–΄μš”. 1932λ…„ 17개 μ—°ν•©κ΅° 단체가 파리 κΈ°μ§€λ₯Ό κ³΅μœ ν•˜λ©΄μ„œ 곡식적인 μˆ˜λ„ κΈ°λŠ₯을 μžƒμ—ˆλ‹€λŠ” μ μ—μ„œ 'νŠΉν—ˆ μˆ˜λ„'둜 κ²€μ—΄λ˜λ©° λ―Έκ΅­, 일본 λ“± 유럽 κ΅­κ°€λ“€ 쀑 파리λ₯Ό μ€‘μ‹¬μœΌλ‘œ ν•œ μ •λΆ€ μ£Όλ„μ˜ ν†΅μΉ˜κ°€ μœ λ €λ˜μ–΄ ν‘œμ€€ν™”λ˜μ—ˆμ£ . \n> **λΉ„μœ **: ν”„λž‘μŠ€ μˆ˜λ„λŠ”
43
+ ```
44
+
45
+ ## Training procedure
46
+
47
+ [<img src="https://raw.githubusercontent.com/wandb/assets/main/wandb-github-badge-28.svg" alt="Visualize in Weights & Biases" width="150" height="24"/>](https://wandb.ai/llm-est/huggingface/runs/mrisof65)
48
+
49
+
50
+ This model was trained with SFT.
51
+
52
+ ### Framework versions
53
+
54
+ - TRL: 0.15.0.dev0
55
+ - Transformers: 4.49.0.dev0
56
+ - Pytorch: 2.5.1
57
+ - Datasets: 3.2.0
58
+ - Tokenizers: 0.21.0
59
+
60
+ ## Citations
61
+
62
+
63
+
64
+ Cite TRL as:
65
+
66
+ ```bibtex
67
+ @misc{vonwerra2022trl,
68
+ title = {{TRL: Transformer Reinforcement Learning}},
69
+ author = {Leandro von Werra and Younes Belkada and Lewis Tunstall and Edward Beeching and Tristan Thrush and Nathan Lambert and Shengyi Huang and Kashif Rasul and Quentin GallouΓ©dec},
70
+ year = 2020,
71
+ journal = {GitHub repository},
72
+ publisher = {GitHub},
73
+ howpublished = {\url{https://github.com/huggingface/trl}}
74
+ }
75
  ```