Text Classification
Transformers
Safetensors
Arabic
bert
arabic
arabert
arcode
text-embeddings-inference
Instructions to use arcode-standard/arcode-bert-v0.1 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use arcode-standard/arcode-bert-v0.1 with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-classification", model="arcode-standard/arcode-bert-v0.1")# Load model directly from transformers import AutoTokenizer, AutoModelForSequenceClassification tokenizer = AutoTokenizer.from_pretrained("arcode-standard/arcode-bert-v0.1") model = AutoModelForSequenceClassification.from_pretrained("arcode-standard/arcode-bert-v0.1", device_map="auto") - Notebooks
- Google Colab
- Kaggle
ArCode-BERT v0.1
نموذج تصنيف نصوص عربية مبني على AraBERTv2، تم تطويره ضمن مشروع ArCode-Standard.
Model Details
Model Description
ArCode-BERT هو نموذج تصنيف نصوص عربية (Multi-class Classification) تم ضبطه بدقة على بيانات متخصصة. يعتمد على نموذج AraBERTv2 كأساس.
- Developed by: ArCode-Standard
- Model type: BERT for Sequence Classification
- Language(s): Arabic
- License: Apache 2.0
- Finetuned from model: aubmindlab/bert-base-arabertv2
Model Sources
- Repository: https://github.com/ArCode-Standard
- Model: https://huggingface.co/arcode-standard/arcode-bert-v0.1
Uses
Direct Use
يمكن استخدام النموذج مباشرة لتصنيف النصوص العربية إلى واحدة من 18 فئة.
Downstream Use
يمكن استخدامه كأساس لبناء أنظمة تصنيف عربية أكثر تخصصاً أو دمجه في تطبيقات أكبر.
Out-of-Scope Use
- غير مناسب للنصوص غير العربية.
- غير مصمم حالياً لمهام أخرى غير التصنيف (مثل توليد النصوص أو الإجابة على الأسئلة).
Bias, Risks, and Limitations
- أداء بعض الفئات (خصوصاً الفئات 1، 8، و16) أضعف نسبياً مقارنة بباقي الفئات.
- الأداء يعتمد على جودة وتنوع البيانات المستخدمة في التدريب.
Recommendations
يُنصح بمراجعة نتائج التصنيف يدوياً في الحالات الحساسة، خاصة مع الفئات ذات الأداء الأضعف.
How to Get Started with the Model
from transformers import AutoModelForSequenceClassification, AutoTokenizer
import torch
model_name = "arcode-standard/arcode-bert-v0.1"
tokenizer = AutoTokenizer.from_pretrained(model_name)
model = AutoModelForSequenceClassification.from_pretrained(model_name)
text = "نص عربي هنا"
inputs = tokenizer(text, return_tensors="pt", truncation=True, padding=True)
with torch.no_grad():
outputs = model(**inputs)
prediction = torch.argmax(outputs.logits, dim=-1).item()
print("Predicted class:", prediction)
- Downloads last month
- 21