Русскоязычные адреса: практические приемы PHP

Раздел: Программирование на PHP -> Локализация

Основные подходы к работе с русскими URL

Наиболее эффективное решение: кодирование через rawurlencode для параметров и транслитерация для ЧПУ

Русские символы в URL не допускаются стандартом RFC 3986. Для корректной передачи данных используется процентное кодирование (percent-encoding). Для параметров запроса (после знака ?) применяется rawurlencode(), который преобразует кириллицу в последовательность вида %D0%9F. Для человекопонятных путей (ЧПУ) лучше выполнять транслитерацию: замена русских букв на латинские. Комбинация этих методов даёт и валидный URL, и удобочитаемость.

Пример функции транслитерации:


function translit($s) {
    $rus = ['а','б','в','г','д','е','ё','ж','з','и','й','к','л','м','н','о','п',
            'р','с','т','у','ф','х','ц','ч','ш','щ','ъ','ы','ь','э','ю','я',
            'А','Б','В','Г','Д','Е','Ё','Ж','З','И','Й','К','Л','М','Н','О','П',
            'Р','С','Т','У','Ф','Х','Ц','Ч','Ш','Щ','Ъ','Ы','Ь','Э','Ю','Я'];
    $lat = ['a','b','v','g','d','e','yo','zh','z','i','y','k','l','m','n','o','p',
            'r','s','t','u','f','kh','ts','ch','sh','shch','','y','','e','yu','ya',
            'A','B','V','G','D','E','Yo','Zh','Z','I','Y','K','L','M','N','O','P',
            'R','S','T','U','F','Kh','Ts','Ch','Sh','Shch','','Y','','E','Yu','Ya'];
    return str_replace($rus, $lat, $s);
}

// Пример использования:
$title = 'Русский URL';
$slug = translit($title);
echo $slug; // Russkiy_URL
    

Для построения полного URL с параметрами:


$base = 'https://example.com/search';
$query = 'русский текст';
$url = $base . '?q=' . rawurlencode($query);
echo $url; // https://example.com/search?q=%D1%80%D1%83%D1%81%D1%81%D0%BA%D0%B8%D0%B9%20%D1%82%D0%B5%D0%BA%D1%81%D1%82
    

Типичные ошибки:

  • Использование urlencode() вместо rawurlencode() - приводит к замене пробела на +, что некорректно для пути (разрешено только для данных формы).
  • Двойное кодирование - если строка уже содержит percent-последовательности, повторный вызов rawurlencode превратит % в %25.
  • Отсутствие проверки кодировки строки - функции работают только с UTF-8; если строка в Windows-1251, результат будет неверным.

Вариант 1: чем отличается urlencode от rawurlencode?

urlencode() кодирует пробел как +, а rawurlencode() - как %20. Для строки запроса (query string) оба допустимы, но для сегментов пути (path) требуется rawurlencode.


$str = 'русский текст';
echo urlencode($str);    // %F0%F3%F1%F1%EA%E8%E9+%F2%E5%EA%F1%F2
echo rawurlencode($str); // %D1%80%D1%83%D1%81%D1%81%D0%BA%D0%B8%D0%B9%20%D1%82%D0%B5%D0%BA%D1%81%D1%82
    

Проблема: при использовании urlencode в пути URL сервер может интерпретировать + как пробел только в query, но не в пути, что приведёт к ошибке 404.

Вариант 2: простая транслитерация при помощи strtr()

Если таблица замен большая, удобнее использовать strtr() с ассоциативным массивом.


$map = [
    'а' => 'a', 'б' => 'b', 'в' => 'v',
    'г' => 'g', 'д' => 'd', 'е' => 'e',
    // ... полная таблица
];
$text = 'Привет мир';
echo strtr(mb_strtolower($text), $map); // privet mir
    

Ошибка: забывают привести строку к нижнему регистру, из-за чего заглавные буквы не заменяются. Также нужно обрабатывать букву ё отдельно.

Вариант 3: использование регулярного выражения для замены символов

Можно применить preg_replace для замены всех нелатинских символов на транслитерацию или пустую строку.


$text = 'Статья про PHP';
// удаляем всё, кроме букв, цифр, дефиса
$slug = preg_replace('/[^a-z0-9-]/i', '-', $text);
echo $slug; // ------------pro-php (нежелательно)
    

Проблема: русские буквы не распознаются и заменяются на дефис, что делает slug нечитаемым. Этот метод годится только для латиницы.

Вариант 4: расширенная транслитерация с помощью Transliterator (модуль intl)

Расширение intl предоставляет класс Transliterator, который умеет преобразовывать кириллицу в латиницу по правилам различных стандартов.


if (class_exists('Transliterator')) {
    $trans = Transliterator::create('Russian-Latin/BGN');
    $result = $trans->transliterate('Щука и Ёрш');
    echo $result; // Shchuka i Yorsh
}
    

Доступен также идентификатор Any-Latin; Latin-ASCII для полной очистки.

Ошибка: модуль intl не всегда установлен на хостинге. Необходимо проверять наличие класса перед вызовом.

Вариант 5: декодирование входящего URL с русскими символами

При получении запроса $_GET['q'] уже декодирован автоматически. Если нужно декодировать явно, используется rawurldecode().


$encoded = '%D1%80%D1%83%D1%81%D1%81%D0%BA%D0%B8%D0%B9';
echo rawurldecode($encoded); // русский
    

Ошибка: если строка была закодирована дважды, однократное декодирование не восстановит исходный текст.

Вариант 6: работа с многобайтовыми строками (mb_* функции)

Все операции над кириллическими строками должны выполняться функциями mb_* для корректного подсчёта длины и поиска.


$str = 'Привет';
echo mb_strlen($str, 'UTF-8'); // 6
echo substr($str, 0, 1); // неверно (отдаст первый байт)
echo mb_substr($str, 0, 1, 'UTF-8'); // П
    

Проблема: игнорирование кодировки приводит к битым строкам при использовании обычных strlen, substr.

Расширенные примеры работы с русскими URL

Пример 1: Полная функция транслитерации с нормализацией

Функция преобразует строку в латинский slug, пригодный для ЧПУ.

Пример

function slugify($text) {
    // транслитерация
    $map = [
        'а' => 'a', 'б' => 'b', 'в' => 'v', 'г' => 'g', 'д' => 'd', 'е' => 'e', 'ё' => 'yo',
        'ж' => 'zh', 'з' => 'z', 'и' => 'i', 'й' => 'y', 'к' => 'k', 'л' => 'l', 'м' => 'm',
        'н' => 'n', 'о' => 'o', 'п' => 'p', 'р' => 'r', 'с' => 's', 'т' => 't', 'у' => 'u',
        'ф' => 'f', 'х' => 'kh', 'ц' => 'ts', 'ч' => 'ch', 'ш' => 'sh', 'щ' => 'shch',
        'ъ' => '', 'ы' => 'y', 'ь' => '', 'э' => 'e', 'ю' => 'yu', 'я' => 'ya',
        'А' => 'A', 'Б' => 'B', 'В' => 'V', 'Г' => 'G', 'Д' => 'D', 'Е' => 'E', 'Ё' => 'Yo',
        'Ж' => 'Zh', 'З' => 'Z', 'И' => 'I', 'Й' => 'Y', 'К' => 'K', 'Л' => 'L', 'М' => 'M',
        'Н' => 'N', 'О' => 'O', 'П' => 'P', 'Р' => 'R', 'С' => 'S', 'Т' => 'T', 'У' => 'U',
        'Ф' => 'F', 'Х' => 'Kh', 'Ц' => 'Ts', 'Ч' => 'Ch', 'Ш' => 'Sh', 'Щ' => 'Shch',
        'Ъ' => '', 'Ы' => 'Y', 'Ь' => '', 'Э' => 'E', 'Ю' => 'Yu', 'Я' => 'Ya'
    ];
    $text = strtr($text, $map);
    // приводим к нижнему регистру
    $text = mb_strtolower($text, 'UTF-8');
    // заменяем пробелы и прочие небуквенные символы на дефис
    $text = preg_replace('/[^a-z0-9-]/', '-', $text);
    // удаляем повторяющиеся дефисы
    $text = preg_replace('/-+/', '-', $text);
    // обрезаем дефисы по краям
    $text = trim($text, '-');
    return $text;
}

echo slugify('Привет! Как дела?'); // privet-kak-dela

Пример 2: Формирование URL с параметрами, содержащими кириллицу

Имитация отправки поискового запроса.

Пример

$base = 'https://api.example.com/search';
$params = [
    'query' => 'русский текст',
    'page' => 2,
    'lang' => 'ru'
];
$url = $base . '?' . http_build_query($params, '', '&', PHP_QUERY_RFC3986);
echo $url;
// https://api.example.com/search?query=%D1%80%D1%83%D1%81%D1%81%D0%BA%D0%B8%D0%B9%20%D1%82%D0%B5%D0%BA%D1%81%D1%82&page=2&lang=ru

Пример 3: Декодирование и обработка входящего URL в роутере

Предположим, фронт-контроллер получает URI с русскими символами (браузер автоматически кодирует).

Пример

$uri = $_SERVER['REQUEST_URI']; // /поиск?q=тест
// разбираем
$path = parse_url($uri, PHP_URL_PATH); // /поиск
$query = parse_url($uri, PHP_URL_QUERY); // q=тест
parse_str($query, $params);
// $params['q'] уже декодирован в 'тест'
var_dump($params);
array(1) {
  ["q"] => string(8) "тест"
}

Пример 4: Использование библиотеки transliterator (intl) для полной обработки

Показывает работу с разными правилами.

Пример

if (extension_loaded('intl')) {
    $strings = ['Москва', 'Санкт-Петербург', 'Нью-Йорк'];
    $rules = ['Russian-Latin/BGN', 'Russian-Latin/ALA-LC', 'Any-Latin; Latin-ASCII'];
    foreach ($rules as $rule) {
        $t = Transliterator::create($rule);
        echo "Rule: $rule\n";
        foreach ($strings as $s) {
            echo $s . ' -> ' . $t->transliterate($s) . "\n";
        }
        echo "\n";
    }
}
Rule: Russian-Latin/BGN
Москва -> Moskva
Санкт-Петербург -> Sankt-Peterburg
Нью-Йорк -> Nyu-York

Rule: Russian-Latin/ALA-LC
Москва -> Moskva
Санкт-Петербург -> Sankt-Peterburg
Нью-Йорк -> Niŭ-Iork

Rule: Any-Latin; Latin-ASCII
Москва -> Moskva
Санкт-Петербург -> Sankt-Peterburg
Нью-Йорк -> Nyu-Iork

Пример 5: Обработка ошибки двойного кодирования

Демонстрация того, как проверить и исправить.

Пример

$bad = '%D1%82%D0%B5%D0%BA%D1%81%D1%82'; // уже закодированный текст
echo 'Двойное кодирование: ' . rawurlencode($bad) . "\n";
$fixed = rawurldecode($bad);
echo 'После декодирования: ' . $fixed . "\n";
// Если входящая строка могла быть закодирована дважды, декодируем дважды:
$doubleEncoded = rawurlencode(rawurlencode('тест'));
echo 'Дважды закодировано: ' . $doubleEncoded . "\n";
$decodedOnce = rawurldecode($doubleEncoded);
echo 'После одного декодирования: ' . $decodedOnce . "\n";
$decodedTwice = rawurldecode($decodedOnce);
echo 'После двух декодирований: ' . $decodedTwice . "\n";
Двойное кодирование: %251%25D1%2582%25D0%25B5%25D0%25BA%25D1%2581%25D1%2582
После декодирования: текст
Дважды закодировано: %25D1%2582%25D0%25B5%25D1%2581%25D1%2582
После одного декодирования: %D1%82%D0%B5%D1%81%D1%82
После двух декодирований: тест

Русский URL в PHP - comments

En
Php русский url (php)