Sentence Similarity
sentence-transformers
Safetensors
Indonesian
bert
indonesian
semantic-similarity
stsb
embedding
fine-tuned
education
Eval Results (legacy)
text-embeddings-inference
Instructions to use eugene702/Automatic-Scoring with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- sentence-transformers
How to use eugene702/Automatic-Scoring with sentence-transformers:
from sentence_transformers import SentenceTransformer model = SentenceTransformer("eugene702/Automatic-Scoring") sentences = [ "The weather is lovely today.", "It's so sunny outside!", "He drove to the stadium." ] embeddings = model.encode(sentences) similarities = model.similarity(embeddings, embeddings) print(similarities.shape) # [3, 3] - Notebooks
- Google Colab
- Kaggle
| language: "id" | |
| license: "apache-2.0" | |
| tags: | |
| - sentence-transformers | |
| - indonesian | |
| - semantic-similarity | |
| - stsb | |
| - embedding | |
| - fine-tuned | |
| - education | |
| datasets: | |
| - rzkamalia/stsb-indo-mt-modified | |
| - quarkss/stsb-indo-mt | |
| - AkshitaS/semrel_2024_plus | |
| metrics: | |
| - cosine-similarity | |
| pipeline_tag: sentence-similarity | |
| model-index: | |
| - name: Automatic Scoring (IndoBERT STS) | |
| results: | |
| - task: | |
| name: Semantic Textual Similarity | |
| type: sentence-similarity | |
| dataset: | |
| name: STSB Indo + SemRel 2024 | |
| type: multiple | |
| metrics: | |
| - name: Cosine Similarity | |
| type: cosine-similarity | |
| value: Evaluated on test set (see below) | |
| # Automatic Scoring for Indonesian Semantic Similarity β¨ | |
| Model ini merupakan hasil fine-tuning dari [`indobenchmark/indobert-large-p2`](https://huggingface.co/indobenchmark/indobert-large-p2) menggunakan Sentence Transformers untuk tugas **Semantic Textual Similarity** (STS) dalam bahasa Indonesia. | |
| Model ini dilatih secara **multi-dataset** menggunakan gabungan dari: | |
| - π’ `rzkamalia/stsb-indo-mt-modified` | |
| - π’ `quarkss/stsb-indo-mt` | |
| - π’ `AkshitaS/semrel_2024_plus` (split `ind_Latn`) | |
| Tujuan utama dari model ini adalah untuk mendukung **penilaian otomatis jawaban siswa** atau sistem pembelajaran berbasis teks dalam bahasa Indonesia. | |
| ## π§ Model Details | |
| - **Base Model**: [`indobenchmark/indobert-large-p2`](https://huggingface.co/indobenchmark/indobert-large-p2) | |
| - **Framework**: `sentence-transformers` | |
| - **Loss Function**: `CosineSimilarityLoss` | |
| - **Training Epochs**: `5` | |
| - **Batch Size**: `16` | |
| - **Evaluation Metric**: `Cosine Similarity` | |
| - **Total Datasets Combined**: 3 corpora (STS Indo + Semantic Relation) | |
| ## π Example Usage | |
| ```python | |
| from sentence_transformers import SentenceTransformer, util | |
| model = SentenceTransformer("eugene702/Automatic-Scoring") | |
| score = util.cos_sim( | |
| model.encode("Apa dampak pemanasan global?", convert_to_tensor=True), | |
| model.encode("Bagaimana pengaruh perubahan iklim terhadap bumi?", convert_to_tensor=True) | |
| ) | |
| print("Similarity Score:", score.item()) | |
| ``` | |
| ## π Datasets Used | |
| | Dataset | Deskripsi | | |
| |--------|-----------| | |
| | [`rzkamalia/stsb-indo-mt-modified`](https://huggingface.co/datasets/rzkamalia/stsb-indo-mt-modified) | Versi modifikasi STS bahasa Indonesia | | |
| | [`quarkss/stsb-indo-mt`](https://huggingface.co/datasets/quarkss/stsb-indo-mt) | STS benchmark bahasa Indonesia | | |
| | [`AkshitaS/semrel_2024_plus`](https://huggingface.co/datasets/AkshitaS/semrel_2024_plus) | Dataset Semantic Relation multilingual split `ind_Latn` | | |
| ## π Evaluation | |
| Evaluasi dilakukan pada data `test` dari ketiga dataset yang digabung. Penilaian dilakukan menggunakan `EmbeddingSimilarityEvaluator` dari `sentence-transformers`. | |
| **Metric utama**: *Cosine Similarity* terhadap pasangan kalimat dalam bahasa Indonesia. | |
| ## π‘ Use Cases | |
| - Penilaian otomatis jawaban siswa | |
| - Deteksi parafrase dalam Bahasa Indonesia | |
| - Penilaian kesamaan kalimat untuk e-learning | |
| - Analisis pertanyaan dan jawaban semantik | |
| ## π Training Code | |
| Model dilatih menggunakan `sentence-transformers` di platform Kaggle. | |
| Kode pelatihan tersedia secara privat namun dapat diminta melalui email. | |
| ## π Model Availability | |
| Model tersedia di: | |
| - Hugging Face: [eugene702/Automatic-Scoring](https://huggingface.co/eugene702/Automatic-Scoring) | |
| - Kaggle Model Hub: [Automatic Scoring](https://www.kaggle.com/models/eugene702/automatic-scoring) | |
| ## π¬ Contact | |
| Untuk pertanyaan atau kolaborasi: | |
| **Eugene Feilian Putra Rangga** | |
| π§ eugenefeilianputrarangga@gmail.com | |
| π [Hugging Face Profile](https://huggingface.co/eugene702) | |
| π [GitHub](https://github.com/Eugene702) | |
| --- | |
| > _Model ini merupakan bagian dari eksperimen untuk membangun sistem penilaian otomatis berbasis semantic similarity pada teks Bahasa Indonesia._ |