Datasets:
Update README.md
Browse files
README.md
CHANGED
|
@@ -21,30 +21,6 @@ dataset_info:
|
|
| 21 |
- name: commonvoice
|
| 22 |
num_bytes: 26613419533.408
|
| 23 |
num_examples: 963636
|
| 24 |
-
- name: openslr
|
| 25 |
-
num_bytes: 2246649669.92
|
| 26 |
-
num_examples: 198789
|
| 27 |
-
- name: madasr
|
| 28 |
-
num_bytes: 6101023454.02
|
| 29 |
-
num_examples: 372065
|
| 30 |
-
- name: shrutilipi
|
| 31 |
-
num_bytes: 5017828548.87
|
| 32 |
-
num_examples: 246370
|
| 33 |
-
- name: flerus
|
| 34 |
-
num_bytes: 120214199.914
|
| 35 |
-
num_examples: 3006
|
| 36 |
-
- name: kathbath
|
| 37 |
-
num_bytes: 92451768.598
|
| 38 |
-
num_examples: 4589
|
| 39 |
-
- name: indictts
|
| 40 |
-
num_bytes: 227151543.152
|
| 41 |
-
num_examples: 12752
|
| 42 |
-
- name: ucla
|
| 43 |
-
num_bytes: 20343224982.168
|
| 44 |
-
num_examples: 1921116
|
| 45 |
-
- name: gali
|
| 46 |
-
num_bytes: 345715480
|
| 47 |
-
num_examples: 10000
|
| 48 |
download_size: 58948504311
|
| 49 |
dataset_size: 61107679180.05001
|
| 50 |
configs:
|
|
@@ -52,22 +28,6 @@ configs:
|
|
| 52 |
data_files:
|
| 53 |
- split: commonvoice
|
| 54 |
path: data/commonvoice-*
|
| 55 |
-
- split: openslr
|
| 56 |
-
path: data/openslr-*
|
| 57 |
-
- split: madasr
|
| 58 |
-
path: data/madasr-*
|
| 59 |
-
- split: shrutilipi
|
| 60 |
-
path: data/shrutilipi-*
|
| 61 |
-
- split: flerus
|
| 62 |
-
path: data/flerus-*
|
| 63 |
-
- split: kathbath
|
| 64 |
-
path: data/kathbath-*
|
| 65 |
-
- split: indictts
|
| 66 |
-
path: data/indictts-*
|
| 67 |
-
- split: ucla
|
| 68 |
-
path: data/ucla-*
|
| 69 |
-
- split: gali
|
| 70 |
-
path: data/gali-*
|
| 71 |
task_categories:
|
| 72 |
- automatic-speech-recognition
|
| 73 |
language:
|
|
@@ -82,15 +42,4 @@ This is a collection of publicly available ASR data for Bengali. It contains **5
|
|
| 82 |
|
| 83 |
# Datasets:
|
| 84 |
|
| 85 |
-
- [commonvoice](https://www.kaggle.com/competitions/bengaliai-speech/data)
|
| 86 |
-
- [openslr](https://www.openslr.org/53)
|
| 87 |
-
- [madasr](https://sites.google.com/view/respinasrchallenge2023/dataset?authuser=0)
|
| 88 |
-
- [shrutilipi](https://ai4bharat.iitm.ac.in/shrutilipi/)
|
| 89 |
-
- [flerus](https://huggingface.co/datasets/google/fleurs/viewer/bn_in)
|
| 90 |
-
- [kathbath](https://huggingface.co/datasets/ai4bharat/kathbath)
|
| 91 |
-
- [indictts](https://github.com/AI4Bharat/vistaar?tab=readme-ov-file#download-training-datasets-and-benchmarks)
|
| 92 |
-
- [ucla](https://huggingface.co/datasets/parambharat/bengali_asr_corpus)
|
| 93 |
-
- gali
|
| 94 |
-
|
| 95 |
-
|
| 96 |
-
|
|
|
|
| 21 |
- name: commonvoice
|
| 22 |
num_bytes: 26613419533.408
|
| 23 |
num_examples: 963636
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 24 |
download_size: 58948504311
|
| 25 |
dataset_size: 61107679180.05001
|
| 26 |
configs:
|
|
|
|
| 28 |
data_files:
|
| 29 |
- split: commonvoice
|
| 30 |
path: data/commonvoice-*
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 31 |
task_categories:
|
| 32 |
- automatic-speech-recognition
|
| 33 |
language:
|
|
|
|
| 42 |
|
| 43 |
# Datasets:
|
| 44 |
|
| 45 |
+
- [commonvoice](https://www.kaggle.com/competitions/bengaliai-speech/data)
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|