ArCode-BERT v0.1

نموذج تصنيف نصوص عربية مبني على AraBERTv2، تم تطويره ضمن مشروع ArCode-Standard.

Model Details

Model Description

ArCode-BERT هو نموذج تصنيف نصوص عربية (Multi-class Classification) تم ضبطه بدقة على بيانات متخصصة. يعتمد على نموذج AraBERTv2 كأساس.

  • Developed by: ArCode-Standard
  • Model type: BERT for Sequence Classification
  • Language(s): Arabic
  • License: Apache 2.0
  • Finetuned from model: aubmindlab/bert-base-arabertv2

Model Sources

Uses

Direct Use

يمكن استخدام النموذج مباشرة لتصنيف النصوص العربية إلى واحدة من 18 فئة.

Downstream Use

يمكن استخدامه كأساس لبناء أنظمة تصنيف عربية أكثر تخصصاً أو دمجه في تطبيقات أكبر.

Out-of-Scope Use

  • غير مناسب للنصوص غير العربية.
  • غير مصمم حالياً لمهام أخرى غير التصنيف (مثل توليد النصوص أو الإجابة على الأسئلة).

Bias, Risks, and Limitations

  • أداء بعض الفئات (خصوصاً الفئات 1، 8، و16) أضعف نسبياً مقارنة بباقي الفئات.
  • الأداء يعتمد على جودة وتنوع البيانات المستخدمة في التدريب.

Recommendations

يُنصح بمراجعة نتائج التصنيف يدوياً في الحالات الحساسة، خاصة مع الفئات ذات الأداء الأضعف.

How to Get Started with the Model

from transformers import AutoModelForSequenceClassification, AutoTokenizer
import torch

model_name = "arcode-standard/arcode-bert-v0.1"
tokenizer = AutoTokenizer.from_pretrained(model_name)
model = AutoModelForSequenceClassification.from_pretrained(model_name)

text = "نص عربي هنا"
inputs = tokenizer(text, return_tensors="pt", truncation=True, padding=True)

with torch.no_grad():
    outputs = model(**inputs)
    prediction = torch.argmax(outputs.logits, dim=-1).item()

print("Predicted class:", prediction)
Downloads last month
21
Safetensors
Model size
0.1B params
Tensor type
F32
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support