У меня есть файл, содержащий строки UNICODE-16, которые я хотел бы прочитать в программе Linux. Строки были записаны в сыром виде из внутреннего формата WCHAR Windows. (Всегда ли Windows использует UTF-16? Например, в японских версиях)
Я полагаю, что могу читать их, используя необработанные чтения и конвертирование с помощью wcstombs_l. Однако я не могу понять, какую локаль использовать. Запуск "locale -a" на моих современных машинах с Ubuntu и Mac OS X дает нулевые локали с utf-16 в их именах.
Есть ли лучший способ?
Обновление: правильный ответ и другие, приведенные ниже, помогли мне указать на использование libiconv. Вот функция, которую я использую для преобразования. В настоящее время он у меня внутри класса, который превращает преобразования в однострочный фрагмент кода.
// Function for converting wchar_t* to char*. (Really: UTF-16LE --> UTF-8)
// It will allocate the space needed for dest. The caller is
// responsible for freeing the memory.
static int iwcstombs_alloc(char **dest, const wchar_t *src)
{
iconv_t cd;
const char from[] = "UTF-16LE";
const char to[] = "UTF-8";
cd = iconv_open(to, from);
if (cd == (iconv_t)-1)
{
printf("iconv_open(\"%s\", \"%s\") failed: %s\n",
to, from, strerror(errno));
return(-1);
}
// How much space do we need?
// Guess that we need the same amount of space as used by src.
// TODO: There should be a while loop around this whole process
// that detects insufficient memory space and reallocates
// more space.
int len = sizeof(wchar_t) * (wcslen(src) + 1);
//printf("len = %d\n", len);
// Allocate space
int destLen = len * sizeof(char);
*dest = (char *)malloc(destLen);
if (*dest == NULL)
{
iconv_close(cd);
return -1;
}
// Convert
size_t inBufBytesLeft = len;
char *inBuf = (char *)src;
size_t outBufBytesLeft = destLen;
char *outBuf = (char *)*dest;
int rc = iconv(cd,
&inBuf,
&inBufBytesLeft,
&outBuf,
&outBufBytesLeft);
if (rc == -1)
{
printf("iconv() failed: %s\n", strerror(errno));
iconv_close(cd);
free(*dest);
*dest = NULL;
return -1;
}
iconv_close(cd);
return 0;
} // iwcstombs_alloc()